Una foresta casuale è una raccolta di alberi decisionali formata selezionando casualmente solo alcune funzionalità con cui costruire ciascun albero (e talvolta inserendo i dati di addestramento). Apparentemente imparano e generalizzano bene. Qualcuno ha fatto il campionamento MCMC dello spazio dell'albero decisionale o li ha confrontati con foreste casuali? So che potrebbe essere più costoso dal punto di vista computazionale eseguire l'MCMC e salvare tutti gli alberi campionati, ma sono interessato alle caratteristiche teoriche di questo modello, non ai costi di calcolo. Quello che voglio dire è qualcosa del genere:
- Costruisci un albero decisionale casuale (probabilmente funzionerebbe in modo orribile)
- Calcola la probabilità dell'albero con qualcosa come , o forse aggiungi un termine .
- Scegli un passaggio casuale per cambiare l'albero e selezionalo in base alla probabilità .
- Ogni N passaggi, salva una copia dell'albero corrente
- Torna a 3 per alcune grandi N * M volte
- Usa la raccolta di M alberi salvati per fare previsioni
Ciò darebbe una prestazione simile alle foreste casuali? Si noti che qui non stiamo eliminando dati o funzionalità validi in nessun passaggio, a differenza delle foreste casuali.