Scienza dei dati

Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo

1
Importanza delle caratteristiche con caratteristiche categoriche ad alta cardinalità per la regressione (variabile numerica dipendente)
Stavo cercando di usare le importazioni delle funzionalità dalle foreste casuali per eseguire alcune selezioni empiriche di funzionalità per un problema di regressione in cui tutte le funzionalità sono categoriche e molte hanno molti livelli (dell'ordine di 100-1000). Dato che la codifica one-hot crea una variabile fittizia per ogni livello, …


4
Come sapere se il modello ha iniziato a funzionare in modo eccessivo?
Spero che i seguenti estratti forniranno una panoramica di quale sarà la mia domanda. Questi sono da http://neuralnetworksanddeeplearning.com/chap3.html L'apprendimento quindi rallenta gradualmente. Alla fine, intorno all'epoca 280, l'accuratezza della classificazione smette praticamente di migliorare. Le epoche successive vedono semplicemente piccole fluttuazioni stocastiche vicino al valore dell'accuratezza nell'epoca 280. Contrastate questo …




3
Tensorflow Regolazione della funzione di costo per dati sbilanciati
Ho un problema di classificazione con dati altamente squilibrati. Ho letto che il sovracampionamento, il sottocampionamento e la modifica dei costi per risultati categorici sottorappresentati porteranno a un adattamento migliore. Prima che ciò avvenisse, Tensorflow avrebbe classificato ogni input come gruppo di maggioranza (e avrebbe ottenuto una precisione superiore al …


3
Hai bisogno di aiuto per comprendere la proposta di punti di divisione approssimativi di xgboost
sfondo: in xgboost le tenta iterazione montare un albero f t su tutte le n esempi che minimizza la seguente obiettivo:tttftftf_tnnn ∑i=1n[gift(xi)+12hif2t(xi)]∑i=1n[gift(xi)+12hift2(xi)]\sum_{i=1}^n[g_if_t(x_i) + \frac{1}{2}h_if_t^2(x_i)] dove sono primo ordine e derivati secondo ordine oltre la nostra precedente stima migliore y (da iterazione t - 1 ):gi,higi,hig_i, h_iy^y^\hat{y}t−1t−1t-1 gi=dy^l(yi,y^)gi=dy^l(yi,y^)g_i=d_{\hat{y}}l(y_i, \hat{y}) hi=d2y^l(yi,y^)hi=dy^2l(yi,y^)h_i=d^2_{\hat{y}}l(y_i, \hat{y}) …
12 xgboost  gbm 


1
Selezione delle funzionalità utilizzando le importazioni delle funzionalità in foreste casuali con scikit-learn
Ho tracciato l'importanza delle funzionalità in foreste casuali con scikit-learn . Al fine di migliorare la previsione utilizzando foreste casuali, come posso utilizzare le informazioni sulla trama per rimuovere le funzionalità? Vale a dire come individuare se una funzione è inutile o, se non peggio, diminuisce le prestazioni delle foreste …


3
Aiuto per quanto riguarda NER in NLTK
Ho lavorato in NLTK per un po 'usando Python. Il problema che sto affrontando è che il loro non è di aiuto disponibile sulla formazione di NER in NLTK con i miei dati personalizzati. Hanno usato MaxEnt e l'hanno addestrato su ACE corpus. Ho cercato molto sul Web, ma non …

2
Modellazione di serie temporali con spaziatura irregolare
Ho una variabile continua, campionata per un periodo di un anno a intervalli irregolari. Alcuni giorni hanno più di un'osservazione all'ora, mentre altri periodi non hanno nulla per giorni. Ciò rende particolarmente difficile rilevare i modelli nelle serie temporali, perché alcuni mesi (ad esempio ottobre) sono altamente campionati, mentre altri …


Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.