Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo
Sto per laurearmi dal mio Master e ho imparato l'apprendimento automatico e ho svolto progetti di ricerca con esso. Mi chiedo quali siano le migliori pratiche del settore quando si eseguono attività di machine learning con Big Dataset (come 100s GB o TB). Apprezzo se i colleghi data scientist possano …
Ho un DataFrame con IDF di determinate parole calcolate. Per esempio (10,[0,1,2,3,4,5],[0.413734499590671,0.4244680552337798,0.4761400657781007, 1.4004620708967006,0.37876590175292424,0.48374466516332]) .... and so on Ora fornisci una query Q, posso calcolare il TF-IDF di questa query. Come posso calcolare la somiglianza del coseno della query con tutti i documenti nel frame di dati (ci sono quasi milioni …
C'è qualche risorsa con un elenco di tecniche di ingegneria delle caratteristiche? Una mappatura di tipo di dati, modello e tecnica di ingegneria delle caratteristiche sarebbe una miniera d'oro
Ho un set di dati per il quale sto cercando di prevedere le variabili target. Col1 Col2 Col3 Col4 Col5 1 2 23 11 1 2 22 12 14 1 22 11 43 38 3 14 22 25 19 3 12 42 11 14 1 22 11 43 38 2 …
Sto cercando di comprendere l'apprendimento per rinforzo e i processi decisionali markov (MDP) nel caso in cui una rete neurale venga utilizzata come approssimatore di funzioni. Sto avendo difficoltà con la relazione tra MDP in cui l'ambiente viene esplorato in modo probabilistico, come questo si ricollega ai parametri di apprendimento …
Quando si implementa la discesa gradiente mini-batch per reti neurali, è importante prendere elementi casuali in ciascun mini-batch? O è sufficiente mescolare gli elementi all'inizio dell'allenamento una volta? (Sono anche interessato a fonti che sicuramente dicono ciò che fanno.)
Quale delle seguenti opzioni di passaggi è quella corretta quando si crea un modello predittivo? Opzione 1: Prima elimina i predittori più ovviamente cattivi e, se necessario, preelabora i rimanenti, quindi addestra vari modelli con convalida incrociata, scegli i pochi migliori, identifica i predittori migliori che ognuno ha utilizzato, quindi …
Supponiamo di avere un livello di input con n neuroni e il primo livello nascosto mmm neuroni, con tipicamente m<nm<nm < n. Quindi calcoli l'attivazioneajun'ja_j del jjj-th neurone nello strato nascosto di aj=f(∑i=1..nwi,jxi+bj)aj=f(∑i=1..nwi,jxi+bj)a_j = f\left(\sum\limits_{i=1..n} w_{i,j} x_i+b_j\right), dove fff è una funzione di attivazione come tanhtanh\tanh o sigmoidsigmoid\text{sigmoid}. Per addestrare …
Quando salvato su disco usando cPickle: /programming/20662023/save-python-random-forest-model-to-file , la mia foresta casuale è di 6.57 GB. with open('rforest.cpickle', 'wb') as f: cPickle.dump(rforest, f) Voglio usare la foresta stessa per fare previsioni tramite un'API python ospitata su Heroku - ovviamente, la dimensione del file è inaccettabile. Perché la dimensione del file …
Sto osservando come implementare il dropout su una rete neurale profonda e ho trovato qualcosa di contro intuitivo. Nella fase di avanzamento della maschera di dropout attivazioni con un tensore casuale di 1 e 0 secondi per forzare la rete ad apprendere la media dei pesi. Questo aiuta la rete …
Sto usando la libreria Seaborn per generare grafici a barre in Python. Mi chiedo quali statistiche vengono utilizzate per calcolare le barre di errore, ma non riesco a trovare alcun riferimento a questo nella documentazione del grafico a barre del Seaborn . So che i valori della barra sono calcolati …
Chiuso. Questa domanda è fuori tema . Al momento non accetta risposte. Vuoi migliorare questa domanda? Aggiorna la domanda in modo che sia in argomento per lo scambio di stack di Data Science. Chiuso 6 anni fa . Sono sempre stato interessato all'apprendimento automatico, ma non riesco a capire una …
I dettagli dell'API di previsione di Google si trovano in questa pagina , ma non sono in grado di trovare alcun dettaglio sugli algoritmi di previsione in esecuzione dietro l'API. Finora ho raccolto che ti consentono di fornire i tuoi passaggi di preelaborazione in formato PMML.
Sto imparando Support Vector Machines e non riesco a capire come viene scelta un'etichetta di classe per un punto dati in un classificatore binario. È scelto per consenso rispetto alla classificazione in ciascuna dimensione dell'iperpiano di separazione?
Ho usato la tecnica smote per sottocampionare il mio set di dati e ora ho un set di dati bilanciato. Il problema che ho dovuto affrontare è che le metriche delle prestazioni; precisione, richiamo, misura f1, accuratezza nel set di dati sbilanciato vengono eseguite meglio rispetto al set di dati …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.