Come calcolare la purezza?


15

Nell'analisi dei cluster come calcoliamo la purezza? Qual è l'equazione?

Non sto cercando un codice per farlo per me.

inserisci qui la descrizione dell'immagine

Sia cluster k e c j la classe j.ωkcj

Quindi la purezza è praticamente accuratezza? sembra che stessero sommando la quantità di classe veramente classificata per cluster sulla dimensione del campione.

fonte dell'equazione

La domanda è: qual è la relazione tra l'output e l'input?

Se c'è Truly Positive (TP), Truly Negative (TN), Falsely Positive (FP), Falsely Negative (FN). È ?Purity=TPK(TP+TN+FP+FN)


3
Se hai solo bisogno di una definizione rapida: la principale ricerca di Google sulla purezza del cluster ** collega qui che fornisce una definizione matematica. (** almeno per me - i tuoi risultati individuali possono differire)
Glen_b -Reinstate Monica

Non ho idea di cosa intendi per "purezza", ma David Colquhoun usa "il saggio magico nero della purezza del cuore" come esempio di campionamento binomiale a pagg. 111-114 del suo eccellente libro di testo Lectures on Biostatistics (1971) che è disponibile come pdf gratuito dal sito Web dell'autore: dcscience.net Anche se è irrilevante per la tua domanda, è una bella storia.
Michael Lew,

Negli alberi di classificazione alcune delle funzioni per misurare l'impurità sono: errore di reintegrazione, indice gini ed entropia. (Gli alberi di classificazione eseguono una forma specifica di raggruppamento, quindi penso che questo dovrebbe essere pertinente.) Spero che questo aiuti!
Angelorf,

Risposte:


25

Nel contesto dell'analisi dei cluster, Purezza è un criterio di valutazione esterno della qualità dei cluster. È la percentuale del numero totale di oggetti (punti dati) che sono stati classificati correttamente, nell'intervallo di unità [0..1].

Purity=1Ni=1kmaxj|citj|

dove N = numero di oggetti (punti dati), k = numero di cluster, ci è un cluster in C e tj è la classificazione che ha il conteggio massimo per il cluster ci

Quando diciamo "correttamente" ciò implica che ogni cluster ci ha identificato un gruppo di oggetti come la stessa classe indicata dalla verità di base. Usiamo la classificazione verità a terra ti di quegli oggetti come la misura di assegnazione correttezza, però per farlo dobbiamo sapere quale gruppo ci mappe per i quali la classificazione verità a terra ti . Se fosse preciso al 100%, ogni ci esattamente a 1 ti , ma in realtà il nostro cicontiene alcuni punti la cui verità fondamentale li ha classificati come diverse altre classificazioni. Naturalmente, allora possiamo vedere che la massima qualità di clustering sarà ottenuta usando la mappatura ci to ti che ha il maggior numero di classificazioni corrette, cioè citi . Ecco da dove viene la max nell'equazione.

Per calcolare la Purezza, crea prima la tua matrice di confusione. Ciò può essere fatto eseguendo il ciclo attraverso ciascun cluster ci e contando quanti oggetti sono stati classificati come ogni classe ti .

   |  T1 |  T2  |  T3
---------------------
C1 |  0  |  53  |  10
C2 |  0  |  1   |  60
C3 |  0  |  16  |  0

Quindi, per ogni cluster ci , selezionare il valore massimo dalla sua riga, sommarli e infine dividere per il numero totale di punti dati.

Purity = (53 + 60 + 16) / 140 = 0.92142

puoi anche rispondere per favore all'entropia?
MonsterMMORPG


tjmaxj
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.