Ho una regressione casuale della foresta creata usando skl e noto che produco risultati diversi in base all'impostazione del seme casuale su valori diversi.
Se uso LOOCV per stabilire quale seme funziona meglio, è un metodo valido?
Ho una regressione casuale della foresta creata usando skl e noto che produco risultati diversi in base all'impostazione del seme casuale su valori diversi.
Se uso LOOCV per stabilire quale seme funziona meglio, è un metodo valido?
Risposte:
La risposta è no .
Il tuo modello fornisce un risultato diverso per ogni seme che usi. Questo è il risultato della natura non deterministica del modello. Scegliendo un seme specifico che massimizza le prestazioni sul set di validazione significa che hai scelto la "disposizione" che meglio si adatta a questo set. Tuttavia, ciò non garantisce che il modello con questo seme avrebbe prestazioni migliori su un set di test separato . Questo significa semplicemente che hai adattato troppo il modello sul set di validazione .
Questo effetto è il motivo per cui vedi molte persone che si classificano in alto nelle competizioni (ad es. Kaggle) sul set di test pubblico, cadendo lontano sul set di test nascosto. Questo approccio non è considerato in alcun modo l'approccio corretto.