Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo
Prendi in considerazione uno stream contenente tuple che (user, new_score) rappresentano i punteggi degli utenti in un gioco online. Il flusso potrebbe contenere 100-1.000 nuovi elementi al secondo. Il gioco ha giocatori unici da 200K a 300K. Vorrei avere alcune domande permanenti come: Quali giocatori hanno pubblicato più di x …
Ad esempio, quando cerchi qualcosa su Google, i risultati ritornano all'istante. Capisco che Google ordina e indicizza le pagine con algoritmi ecc., Ma immagino che non sia possibile indicizzare i risultati di ogni singola query possibile (e i risultati sono personalizzati, il che rende ciò ancora più irrealizzabile)? Inoltre, la …
Esistono delle regole empiriche (o regole effettive) relative alla quantità minima, massima e "ragionevole" di celle LSTM che dovrei usare? In particolare mi riferisco a BasicLSTMCell di TensorFlow e num_unitsproprietà. Si prega di supporre che ho un problema di classificazione definito da: t - number of time steps n - …
Finora ci sono molte applicazioni interessanti per l'apprendimento profondo nella visione artificiale o nell'elaborazione del linguaggio naturale. Com'è in altri campi più tradizionali? Ad esempio, ho variabili sociodemografiche tradizionali e forse molte misurazioni di laboratorio e voglio prevedere una certa malattia. Sarebbe un'applicazione di deep learning se avessi molte osservazioni? …
Sto studiando l'apprendimento automatico e vorrei sapere come calcolare la dimensione VC. Per esempio: h(x)={10if a≤x≤belse h(x)={1if a≤x≤b0else h(x)=\begin{cases} 1 &\mbox{if } a\leq x \leq b \\ 0 & \mbox{else } \end{cases} , con parametri .(a,b)∈R2(a,b)∈R2(a,b) ∈ R^2 Qual è la dimensione VC di esso?
Qualcuno ha usato (e apprezzato) qualche buon pacchetto di "mining di sequenze frequenti" in Python diverso dall'FPM in MLLib? Sto cercando un pacchetto stabile, preferibilmente fermo gestito da persone. Grazie!
Come posso importare un file .csv in frame di dati pyspark? Ho anche provato a leggere il file CSV in Pandas e poi a convertirlo in un scintilla dataframe usando createDataFrame, ma mostra ancora qualche errore. Qualcuno può guidarmi attraverso questo? Inoltre, per favore dimmi come posso importare un file …
Ho due frame di dati df1 e df2 e vorrei unirli in un singolo frame di dati. È come se df1 e df2 fossero creati dividendo verticalmente un singolo frame di dati al centro, come se si strappasse un pezzo di carta che contiene un elenco a metà in modo …
Per quanto ne so lo sviluppo di algoritmi per risolvere il problema Frequent Pattern Mining (FPM), la strada dei miglioramenti ha alcuni punti di controllo principali. In primo luogo, l' algoritmo Apriori è stato proposto nel 1993, da Agrawal et al. , insieme alla formalizzazione del problema. L'algoritmo è stato …
Ho un set di dati con ~ 1M righe e ~ 500K caratteristiche sparse. Voglio ridurre la dimensionalità da qualche parte nell'ordine delle caratteristiche dense 1K-5K. sklearn.decomposition.PCAnon funziona su dati sparsi e ho provato a usare sklearn.decomposition.TruncatedSVDma ho un errore di memoria abbastanza rapidamente. Quali sono le mie opzioni per …
Si consideri un frame di dati pyspark costituito da elementi "null" ed elementi numerici. In generale, gli elementi numerici hanno valori diversi. Come è possibile sostituire tutti i valori numerici del frame di dati con un valore numerico costante (ad esempio il valore 1)? Grazie in anticipo! Esempio per il …
Capisco cosa fa lo scalare standard e cosa fa il normalizzatore, secondo la documentazione di scikit: normalizzatore , scaler standard . So quando viene applicato lo scaler standard. Ma in quale scenario viene applicato Normalizer? Ci sono scenari in cui uno è preferito rispetto all'altro?
Ho appena adattato una curva logistica ad alcuni dati falsi. Ho reso i dati essenzialmente una funzione di passaggio. data = -------------++++++++++++++ Ma quando guardo la curva adattata, la pendenza è molto piccola. La funzione che minimizza al meglio la funzione di costo, assumendo l'entropia incrociata, è la funzione di …
La seguente domanda visualizzata nell'immagine è stata posta durante uno degli esami di recente. Non sono sicuro di aver compreso correttamente il principio del rasoio di Occam o no. Secondo le distribuzioni e i confini delle decisioni indicati nella domanda e seguendo l'Occam's Razor, il limite delle decisioni B in …
Sto prototipando un'applicazione e ho bisogno di un modello linguistico per calcolare la perplessità su alcune frasi generate. Esiste un modello di linguaggio addestrato in Python che posso usare facilmente? Qualcosa di semplice come model = LanguageModel('en') p1 = model.perplexity('This is a well constructed sentence') p2 = model.perplexity('Bunny lamp robert …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.