Scienza dei dati

Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo

2
Conseguenza del ridimensionamento delle funzioni
Attualmente sto usando SVM e ridimensionando le mie funzioni di allenamento nella gamma di [0,1]. Prima inserisco / trasformo il mio set di allenamento e quindi applico la stessa trasformazione al mio set di test. Per esempio: ### Configure transformation and apply to training set min_max_scaler = MinMaxScaler(feature_range=(0, 1)) X_train …

4
Utilizzo del clustering nell'elaborazione del testo
Ciao, questa è la mia prima domanda nello stack di Data Science. Voglio creare un algoritmo per la classificazione del testo. Supponiamo che io abbia una grande serie di testi e articoli. Diciamo circa 5000 semplici testi. Per prima cosa uso una semplice funzione per determinare la frequenza di tutte …


2
Contabilità delle prove e dei risultati dell'esperimento
Sono un ricercatore e mi piace testare soluzioni praticabili, quindi tendo a fare molti esperimenti. Ad esempio, se sto calcolando un punteggio di somiglianza tra documenti, potrei voler provare molte misure. In effetti, per ciascuna misura potrebbe essere necessario eseguire diverse corse per testare l'effetto di alcuni parametri. Finora, ho …

3
Relazione tra KS, AUROC e Gini
Le statistiche comuni di validazione del modello come il test di Kolmogorov – Smirnov (KS), AUROC e coefficiente di Gini sono tutte funzionalmente correlate. Tuttavia, la mia domanda ha a che fare con la dimostrazione di come siano tutti correlati. Sono curioso di sapere se qualcuno mi può aiutare a …


1
Implementazione di t-SNE Python: divergenza di Kullback-Leibler
t-SNE, come in [1], agisce riducendo progressivamente la divergenza di Kullback-Leibler (KL), fino a quando non viene soddisfatta una certa condizione. I creatori di t-SNE suggeriscono di usare la divergenza di KL come criterio di prestazione per le visualizzazioni: puoi confrontare le divergenze di Kullback-Leibler riportate da t-SNE. Va benissimo …


4
Lavorare con i cluster HPC
Nella mia università, abbiamo un cluster di elaborazione HPC. Uso il cluster per addestrare classificatori e così via. Quindi, di solito, per inviare un lavoro al cluster, (ad esempio script python scikit-learn), devo scrivere uno script Bash che contenga (tra gli altri) un comando simile qsub script.py. Tuttavia, trovo questo …



3
Come elaborare le query in linguaggio naturale?
Sono curioso di interrogare il linguaggio naturale. Stanford ha quello che sembra essere un potente set di software per l'elaborazione del linguaggio naturale . Ho anche visto la libreria Apache OpenNLP e l' architettura generale per l'ingegneria del testo . Esistono moltissimi usi per l'elaborazione del linguaggio naturale e ciò …
11 nlp 


1
scikit-learn parametro n_jobs su utilizzo e memoria della CPU
Nella maggior parte degli stimatori su scikit-learn, c'è un n_jobsparametro in fit/ predictmetodi per creare lavori paralleli usando joblib. Ho notato che impostandolo su -1crea solo 1 processo Python e massimizza i core, facendo sì che l'utilizzo della CPU raggiunga il 2500% in cima. Questo è abbastanza diverso dall'impostarlo su …


Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.