Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo
Attualmente sto usando SVM e ridimensionando le mie funzioni di allenamento nella gamma di [0,1]. Prima inserisco / trasformo il mio set di allenamento e quindi applico la stessa trasformazione al mio set di test. Per esempio: ### Configure transformation and apply to training set min_max_scaler = MinMaxScaler(feature_range=(0, 1)) X_train …
Ciao, questa è la mia prima domanda nello stack di Data Science. Voglio creare un algoritmo per la classificazione del testo. Supponiamo che io abbia una grande serie di testi e articoli. Diciamo circa 5000 semplici testi. Per prima cosa uso una semplice funzione per determinare la frequenza di tutte …
Voglio fare una previsione per il risultato delle elezioni parlamentari. La mia produzione sarà la% che ciascuna parte riceve. Vi sono più di 2 parti, quindi la regressione logistica non è un'opzione praticabile. Potrei fare una regressione separata per ciascuna parte, ma in tal caso i risultati sarebbero in qualche …
Sono un ricercatore e mi piace testare soluzioni praticabili, quindi tendo a fare molti esperimenti. Ad esempio, se sto calcolando un punteggio di somiglianza tra documenti, potrei voler provare molte misure. In effetti, per ciascuna misura potrebbe essere necessario eseguire diverse corse per testare l'effetto di alcuni parametri. Finora, ho …
Le statistiche comuni di validazione del modello come il test di Kolmogorov – Smirnov (KS), AUROC e coefficiente di Gini sono tutte funzionalmente correlate. Tuttavia, la mia domanda ha a che fare con la dimostrazione di come siano tutti correlati. Sono curioso di sapere se qualcuno mi può aiutare a …
Ho implementato il sistema NER con l'uso dell'algoritmo CRF con le mie caratteristiche artigianali che hanno dato risultati abbastanza buoni. Il fatto è che ho usato molte funzionalità diverse tra cui tag POS e lemmi. Ora voglio creare lo stesso NER per una lingua diversa. Il problema qui è che …
t-SNE, come in [1], agisce riducendo progressivamente la divergenza di Kullback-Leibler (KL), fino a quando non viene soddisfatta una certa condizione. I creatori di t-SNE suggeriscono di usare la divergenza di KL come criterio di prestazione per le visualizzazioni: puoi confrontare le divergenze di Kullback-Leibler riportate da t-SNE. Va benissimo …
Voglio tracciare i byte da un'immagine del disco per capire un modello in essi. Questo è principalmente un compito accademico, poiché sono quasi sicuro che questo modello sia stato creato da un programma di test del disco, ma mi piacerebbe comunque decodificarlo. So già che il modello è allineato, con …
Nella mia università, abbiamo un cluster di elaborazione HPC. Uso il cluster per addestrare classificatori e così via. Quindi, di solito, per inviare un lavoro al cluster, (ad esempio script python scikit-learn), devo scrivere uno script Bash che contenga (tra gli altri) un comando simile qsub script.py. Tuttavia, trovo questo …
Esistono molte fonti che forniscono i dati storici sullo stock ma forniscono solo i campi OHLC insieme al volume e alla chiusura corretta. Anche un paio di fonti che ho trovato forniscono set di dati sulla capitalizzazione di mercato, ma sono limitati ai titoli statunitensi. Yahoo Finance fornisce questi dati …
Mi piacerebbe esplorare la "scienza dei dati". Il termine mi sembra un po 'vago, ma mi aspetto che richieda: apprendimento automatico (piuttosto che statistiche tradizionali); un set di dati abbastanza grande che è necessario eseguire analisi sui cluster. Quali sono alcuni buoni set di dati e problemi, accessibili a uno …
Sono curioso di interrogare il linguaggio naturale. Stanford ha quello che sembra essere un potente set di software per l'elaborazione del linguaggio naturale . Ho anche visto la libreria Apache OpenNLP e l' architettura generale per l'ingegneria del testo . Esistono moltissimi usi per l'elaborazione del linguaggio naturale e ciò …
La consueta definizione di regressione (per quanto ne so) prevede una variabile di output continua da un determinato set di variabili di input . La regressione logistica è un algoritmo di classificazione binaria, quindi produce un output categoriale. È davvero un algoritmo di regressione? Se è così, perché?
Nella maggior parte degli stimatori su scikit-learn, c'è un n_jobsparametro in fit/ predictmetodi per creare lavori paralleli usando joblib. Ho notato che impostandolo su -1crea solo 1 processo Python e massimizza i core, facendo sì che l'utilizzo della CPU raggiunga il 2500% in cima. Questo è abbastanza diverso dall'impostarlo su …
Qualcuno può suggerire qual è la fase corretta per rimuovere le variabili correlate prima dell'ingegnerizzazione delle funzionalità o dopo l'ingegneria delle funzionalità?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.