Mi chiedo se è una buona idea rimuovere quelle variabili con un valore di importanza variabile negativa ("% IncMSE") in un contesto di regressione. E se mi dà una previsione migliore? Cosa ne pensi?
Questo è solo un esempio che ho riscontrato più volte, quindi non ho dati di esempio. Esecuzione di un modello di regressione lineare in R: a.lm = lm(Y ~ x1 + x2) x1è una variabile continua. x2è categorico e ha tre valori, ad esempio "Basso", "Medio" e "Alto". Tuttavia, l'output …
Supponiamo di avere un campione di due popolazioni: Ae B. Supponiamo che queste popolazioni siano composte da individui e scegliamo di descriverli in termini di caratteristiche. Alcune di queste funzioni sono categoriche (ad esempio, guidano per funzionare?) E alcune sono numeriche (ad esempio, la loro altezza). Chiamiamo queste funzionalità: . …
Ho letto i classificatori algebrici: un approccio generico alla convalida incrociata rapida, alla formazione online e alla formazione parallela e sono rimasto sorpreso dalle prestazioni degli algoritmi derivati. Tuttavia, sembra che oltre a Naive Bayes (e GBM) non ci siano molti algoritmi adattati al framework. Ci sono altri articoli che …
Come posso assegnare più peso alle osservazioni più recenti in R? Presumo che sia una domanda o un desiderio comune, ma ho difficoltà a capire esattamente come implementarlo. Ho provato a cercare molto per questo, ma non riesco a trovare un buon esempio pratico. Nel mio esempio avrei un set …
In Random Forest, ogni albero viene cresciuto in parallelo su un unico esempio di boostrap dei dati. Poiché ci si aspetta che ogni campione di boostrap contenga circa il 63% di osservazioni uniche, questo lascia circa il 37% di osservazioni che possono essere utilizzate per testare l'albero. Ora, sembra che …
1) Come posso modificare la soglia di classificazione (penso che sia di default 0,5) in RandomForest in sklearn? 2) come posso sottocampionare in sklearn? 3) Ho il seguente risultato dal classificatore RandomForest: [[1635 1297] [520 3624]] precision recall f1-score support class 0 0.76 0.56 0.64 2932 class 1 0.74 0.87 …
Sto usando il regressore RandomForest sui miei dati e ho potuto vedere che il punteggio OOB è stato ottenuto per essere 0,83. Non sono sicuro di come sia venuto fuori così. Voglio dire, i miei obiettivi sono valori alti nell'intervallo di 10 ^ 7. Quindi, se è MSE, avrebbe dovuto …
Ho un randomForestmodello di classificazione che vorrei utilizzare in un'applicazione che prevede la classe di un nuovo caso. Il nuovo caso ha inevitabilmente valori mancanti. Predict non funzionerà come tale per i NA. Come dovrei farlo allora? data(iris) # create first the new case with missing values na.row<-45 na.col<-c(3,5) case.na<-iris[na.row,] …
Supponiamo di avere un campione di frequenze di 4 possibili eventi: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 e ho le probabilità attese dei miei eventi: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 Con la somma delle frequenze osservate dei …
I seguenti innesti sono presi da questo articolo . Sono un novizio di bootstrap e sto cercando di implementare il bootstrap bootstrap parametrico, semiparametrico e non parametrico per il modello misto lineare con R bootpacchetto. Codice R Ecco il mio Rcodice: library(SASmixed) library(lme4) library(boot) fm1Cult <- lmer(drywt ~ Inoc + …
Sto usando il pacchetto randomForest in R (R versione 2.13.1, randomForest versione 4.6-2) per la regressione e ho notato una distorsione significativa nei miei risultati: l'errore di previsione dipende dal valore della variabile di risposta. I valori alti sono sottostimati e quelli bassi sono sovrastimati. Inizialmente sospettavo che questa fosse …
Una recente domanda sulle alternative alla regressione logistica in R ha prodotto una varietà di risposte tra cui randomForest, gbm, rpart, bayesglm e modelli di additivi generalizzati. Quali sono le differenze pratiche e interpretative tra questi metodi e la regressione logistica? Quali ipotesi fanno (o non fanno) in relazione alla …
La mia domanda riguarda la classificazione binaria, diciamo che separa i clienti buoni da quelli cattivi, ma non la regressione o la classificazione non binaria. In questo contesto, una foresta casuale è un insieme di alberi di classificazione. Per ogni osservazione, ogni albero vota un "sì" o "no" e il …
Basato su Gradient Boosting Tree vs Random Forest . GBDT e RF utilizzano strategie diverse per contrastare la distorsione e la variazione. La mia domanda è che posso ricampionare il set di dati (con la sostituzione) per addestrare più GBDT e combinare le loro previsioni come risultato finale? È equivalente …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.