Sto giocando con un randomForest e ho scoperto che generalmente aumentare il sampSize porta a prestazioni migliori. Esiste una regola / formula / ecc. Che suggerisce quale dovrebbe essere il sampSize ottimale o è una cosa di prova ed errore? Immagino un altro modo di esprimerlo; quali sono i miei rischi di una dimensione del campione troppo piccola o troppo grande (overfitting?)?
Questa domanda si riferisce all'implementazione R della foresta casuale nel randomForestpacchetto. La funzione randomForestha un parametro sampSizeche è descritto nella documentazione come
Dimensioni del campione da disegnare. Per la classificazione, se sampsize è un vettore della lunghezza del numero di strati, il campionamento viene stratificato per strati e gli elementi di sampsize indicano i numeri da trarre dagli strati.