Cosa si intende per vicinanza nelle foreste casuali?


13

Mi sono imbattuto nel termine prossimità in foreste casuali. Ma non riuscivo a capire cosa facesse nelle foreste casuali. In che modo aiuta a fini di classificazione?

Risposte:


13

Il termine "prossimità" indica la "vicinanza" o "vicinanza" tra coppie di casi.

Le prossimità sono calcolate per ogni coppia di casi / osservazioni / punti campione. Se due casi occupano lo stesso nodo terminale attraverso un albero, la loro vicinanza aumenta di uno. Alla fine della corsa di tutti gli alberi, le vicinanze sono normalizzate dividendo per il numero di alberi. Le prossimità vengono utilizzate per sostituire i dati mancanti, individuare i valori anomali e produrre viste illuminate a bassa dimensione dei dati.

vicinanze

Le prossimità originariamente formavano una matrice NxN. Dopo che un albero è cresciuto, metti tutti i dati, sia in allenamento che in caduta, lungo l'albero. Se i casi k e n si trovano nello stesso nodo terminale, aumentare la loro vicinanza di uno. Alla fine, normalizzare le prossimità dividendo per il numero di alberi.

Gli utenti hanno notato che con set di dati di grandi dimensioni, non potevano adattare una matrice NxN nella memoria veloce. Una modifica ha ridotto la dimensione della memoria richiesta a NxT dove T è il numero di alberi nella foresta. Per accelerare il ridimensionamento ad alta intensità di calcolo e la sostituzione iterativa del valore mancante, all'utente viene data la possibilità di conservare solo le nrnn distanze più grandi per ciascun caso.

Quando è presente un set di test, è possibile calcolare anche le vicinanze di ciascun caso nel set di test con ciascun caso nel set di allenamento. La quantità di elaborazione aggiuntiva è moderata.

citazione: https://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm


Cosa significa "nrnn"? Stavo leggendo la pagina di Adele Cutler (o forse Breiman perché non posso dire chi sta scrivendo cosa qui) sulle RF e non riesco a trovare dove definiscono nrnn. (Potrebbe benissimo essere un termine di algebra lineare con cui non ho familiarità.
Tanner Strunk

nrnn = il numero dei vicini più vicini per i quali calcolare le prossimità. Fonte: math.usu.edu/adele/RandomForests/ENAR.pdf pagina 161
klumbard

0

Si noti che gli autori di Elements of Statistical Learning affermano che "I diagrammi di prossimità per foreste casuali spesso sembrano molto simili, indipendentemente dai dati, il che mette in dubbio la loro utilità. Tendono ad avere una forma a stella, un braccio per classe, che è più pronunciato migliore è il rendimento in classifica ". (p 595)

Tuttavia, penso che questi autori non menzionino il modo in cui le foreste casuali trattano così tanto i dati mancanti (anche se menzionano i dati mancanti con gli alberi all'inizio del libro); forse gli autori non hanno semplicemente messo in luce questo aspetto delle RF, il che ha senso considerando che il libro è enorme e ha molte informazioni su molti argomenti / tecniche di apprendimento automatico. Tuttavia, non penso che avere le trame dia forme simili per qualsiasi RF e set di dati significhi qualcosa di negativo sulle RF in generale. Ad esempio, la regressione lineare sembra sostanzialmente sempre la stessa, ma vale la pena sapere quali punti si trovano vicino alla linea e quali sembrano essere anomali dal punto di vista della regressione lineare. Quindi ... il loro commento sull'utilità dei diagrammi di prossimità non ha senso per me.

Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.