Mi sono imbattuto nel termine prossimità in foreste casuali. Ma non riuscivo a capire cosa facesse nelle foreste casuali. In che modo aiuta a fini di classificazione?
Mi sono imbattuto nel termine prossimità in foreste casuali. Ma non riuscivo a capire cosa facesse nelle foreste casuali. In che modo aiuta a fini di classificazione?
Risposte:
Il termine "prossimità" indica la "vicinanza" o "vicinanza" tra coppie di casi.
Le prossimità sono calcolate per ogni coppia di casi / osservazioni / punti campione. Se due casi occupano lo stesso nodo terminale attraverso un albero, la loro vicinanza aumenta di uno. Alla fine della corsa di tutti gli alberi, le vicinanze sono normalizzate dividendo per il numero di alberi. Le prossimità vengono utilizzate per sostituire i dati mancanti, individuare i valori anomali e produrre viste illuminate a bassa dimensione dei dati.
vicinanze
Le prossimità originariamente formavano una matrice NxN. Dopo che un albero è cresciuto, metti tutti i dati, sia in allenamento che in caduta, lungo l'albero. Se i casi k e n si trovano nello stesso nodo terminale, aumentare la loro vicinanza di uno. Alla fine, normalizzare le prossimità dividendo per il numero di alberi.
Gli utenti hanno notato che con set di dati di grandi dimensioni, non potevano adattare una matrice NxN nella memoria veloce. Una modifica ha ridotto la dimensione della memoria richiesta a NxT dove T è il numero di alberi nella foresta. Per accelerare il ridimensionamento ad alta intensità di calcolo e la sostituzione iterativa del valore mancante, all'utente viene data la possibilità di conservare solo le nrnn distanze più grandi per ciascun caso.
Quando è presente un set di test, è possibile calcolare anche le vicinanze di ciascun caso nel set di test con ciascun caso nel set di allenamento. La quantità di elaborazione aggiuntiva è moderata.
citazione: https://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm
Si noti che gli autori di Elements of Statistical Learning affermano che "I diagrammi di prossimità per foreste casuali spesso sembrano molto simili, indipendentemente dai dati, il che mette in dubbio la loro utilità. Tendono ad avere una forma a stella, un braccio per classe, che è più pronunciato migliore è il rendimento in classifica ". (p 595)
Tuttavia, penso che questi autori non menzionino il modo in cui le foreste casuali trattano così tanto i dati mancanti (anche se menzionano i dati mancanti con gli alberi all'inizio del libro); forse gli autori non hanno semplicemente messo in luce questo aspetto delle RF, il che ha senso considerando che il libro è enorme e ha molte informazioni su molti argomenti / tecniche di apprendimento automatico. Tuttavia, non penso che avere le trame dia forme simili per qualsiasi RF e set di dati significhi qualcosa di negativo sulle RF in generale. Ad esempio, la regressione lineare sembra sostanzialmente sempre la stessa, ma vale la pena sapere quali punti si trovano vicino alla linea e quali sembrano essere anomali dal punto di vista della regressione lineare. Quindi ... il loro commento sull'utilità dei diagrammi di prossimità non ha senso per me.