Nel contesto dell'analisi dei cluster, Purezza è un criterio di valutazione esterno della qualità dei cluster. È la percentuale del numero totale di oggetti (punti dati) che sono stati classificati correttamente, nell'intervallo di unità [0..1].
Purity=1N∑i=1kmaxj|ci∩tj|
dove N = numero di oggetti (punti dati), k = numero di cluster, ci è un cluster in C e tj è la classificazione che ha il conteggio massimo per il cluster ci
Quando diciamo "correttamente" ciò implica che ogni cluster ci ha identificato un gruppo di oggetti come la stessa classe indicata dalla verità di base. Usiamo la classificazione verità a terra ti di quegli oggetti come la misura di assegnazione correttezza, però per farlo dobbiamo sapere quale gruppo ci mappe per i quali la classificazione verità a terra ti . Se fosse preciso al 100%, ogni ci esattamente a 1 ti , ma in realtà il nostro cicontiene alcuni punti la cui verità fondamentale li ha classificati come diverse altre classificazioni. Naturalmente, allora possiamo vedere che la massima qualità di clustering sarà ottenuta usando la mappatura ci to ti che ha il maggior numero di classificazioni corrette, cioè ci∩ti . Ecco da dove viene la max nell'equazione.
Per calcolare la Purezza, crea prima la tua matrice di confusione. Ciò può essere fatto eseguendo il ciclo attraverso ciascun cluster ci e contando quanti oggetti sono stati classificati come ogni classe ti .
| T1 | T2 | T3
---------------------
C1 | 0 | 53 | 10
C2 | 0 | 1 | 60
C3 | 0 | 16 | 0
Quindi, per ogni cluster ci , selezionare il valore massimo dalla sua riga, sommarli e infine dividere per il numero totale di punti dati.
Purity = (53 + 60 + 16) / 140 = 0.92142