Come posso dire che non ci sono schemi nei risultati della PCA?


9

Ho un set di dati 1000+ campioni di 19 variabili. Il mio obiettivo è prevedere una variabile binaria in base alle altre 18 variabili (binaria e continua). Sono abbastanza fiducioso che 6 delle variabili di previsione siano associate alla risposta binaria, tuttavia, vorrei analizzare ulteriormente il set di dati e cercare altre associazioni o strutture che potrebbero mancare. Per fare ciò, ho deciso di utilizzare PCA e clustering.

Quando si esegue il PCA sui dati normalizzati, risulta che è necessario conservare 11 componenti per mantenere l'85% della varianza. inserisci qui la descrizione dell'immagine Tracciando i grafici a coppie ottengo questo: inserisci qui la descrizione dell'immagine

Non sono sicuro di cosa succederà ... Non vedo alcun modello significativo nel pca e mi chiedo cosa significhi e se ciò potrebbe essere stato causato dal fatto che alcune delle variabili sono binarie. Eseguendo un algoritmo di clustering con 6 cluster ottengo il seguente risultato che non è esattamente un miglioramento, anche se alcuni BLOB sembrano distinguersi (quelli gialli). inserisci qui la descrizione dell'immagine

Come probabilmente puoi dire, non sono un esperto di PCA, ma ho visto alcuni tutorial e come può essere potente avere una visione delle strutture in uno spazio ad alta dimensione. Con il famoso set di dati delle cifre MNIST (o IRIS) funziona alla grande. La mia domanda è: cosa devo fare ora per dare più senso al PCA? Il clustering non sembra raccogliere nulla di utile, come posso dire che non ci sono pattern nel PCA o cosa dovrei provare dopo per trovare pattern nei dati PCA?


Perché stai facendo PCA al fine di trovare predittori? Perché non usare qualche altro metodo? ad es. potresti includerli tutti in un registro logistico, puoi usare LASSO, puoi costruire un modello ad albero, ci sono insaccamenti, potenziamenti, ecc.
Peter Flom

Cosa intendi specificamente con "modello" che PCA è buono da rivelare?
ttnphns,

@ttnphns quello che sto cercando di fare è trovare alcuni sottogruppi di osservazioni che potrebbero avere qualcosa in comune per spiegare meglio l'esito della risposta binaria che sto cercando di prevedere (questo è stato in parte ispirato da dailyanalytics.ca/2014/ 06 / ... ). Usando anche pca e clustering sul set di dati dell'iride è utile isolare la specie ( scikit-learn.org/stable/auto_examples/decomposition/… ) sebbene ciò sia semplicissimo poiché conosciamo già il numero di cluster.
Mickkk,

@PeterFlom Ho già eseguito la regressione logistica e un modello di foresta casuale e si stanno comportando in modo decente, tuttavia vorrei approfondire ulteriormente i dati.
Mickkk,

Risposte:


7

Mi hai spiegato che la trama della varianza mi dice che qui il PCA non ha senso. 18/11 è del 61%, quindi è necessario il 61% delle variabili per spiegare l'85% della varianza. Questo non è il caso di PCA, secondo me. Uso PCA quando 3-5 fattori su 18 spiegano circa il 95% della varianza.

AGGIORNAMENTO: guarda il grafico della percentuale cumulativa di varianza spiegata dal numero di PC. Questo deriva dal campo di modellizzazione della struttura dei termini dei tassi di interesse. Si vede come 3 componenti spiegano oltre il 99% della varianza totale. Questo può sembrare un esempio inventato per la pubblicità PCA :) Tuttavia, questa è una cosa reale. I tenori dei tassi di interesse sono molto correlati, ecco perché la PCA è molto naturale in questa applicazione. Invece di trattare con un paio di dozzine di tenori, hai a che fare solo con 3 componenti.

inserisci qui la descrizione dell'immagine


Questo è quello che sospettavo in primo luogo. Non l'ho sottolineato direttamente perché non so molto su PCA per fare una dichiarazione così audace. È sicuro dire che quando è necessario più del x% dei componenti, la PCA non è di grande aiuto? Voglio dire, negli esempi di applicazione che ho visto, di solito pochi componenti spiegano la maggiore varianza.
Mickkk,

@mickkk, non esiste una regola ferma. Per me l'indicazione è convessità, il grafico spiegato varianza. Se lo disegni come una percentuale cumulativa della varianza totale spiegata dal numero di PC, allora vuoi vedere un grafico molto concavo. Saresti stato vicino al lineare: ogni componente sembra trasportare all'incirca le stesse informazioni sui dati, in questo caso perché usare PCA al posto dei dati originali?
Aksakal,

La modifica con il nuovo esempio è stata molto utile.
Mickkk,

5

N>1000p=19

Se sei sicuro che solo un sottoinsieme delle variabili sia realmente esplicativo, l'utilizzo di un modello di regressione sparsa, ad esempio Elastic Net, potrebbe aiutarti a stabilire questo.

Inoltre, l'interpretazione dei risultati della PCA utilizzando input di tipo misto (binario vs reale, scale diverse ecc., Vedere la domanda CV qui ) non è così semplice e si potrebbe desiderare di evitarlo a meno che non ci sia una ragione chiara per farlo.


4

Interpreterò la tua domanda nel modo più succinto possibile. Fammi sapere se cambia il tuo significato.

Sono abbastanza sicuro che 6 delle variabili di previsione siano associate alla risposta binaria [ma] non vedo alcun modello significativo nel pca

Non vedo alcun "modello significativo", a parte la coerenza nei tuoi grafici a coppie. Sono solo chiazze approssimativamente circolari. Sono curioso di sapere cosa ti aspettavi di vedere. Cluster di punti chiaramente separati alcuni dei grafici a coppie? Qualche trama molto vicina al lineare?

I risultati della tua PCA - i grafici a coppie bloblike e solo l'85% della varianza catturati negli 11 principali componenti principali - non precludono il sospetto che circa 6 variabili siano sufficienti per la previsione della risposta binaria.

Immagina queste situazioni:

  1. Supponiamo che i risultati della PCA mostrino che il 99% della varianza viene catturato da 6 componenti principali.

    Ciò potrebbe sembrare a sostegno del tuo sospetto circa 6 variabili predittive - forse potresti definire un piano o un'altra superficie in quello spazio 6 dimensionale che classifica molto bene i punti e potresti usare quella superficie come un predittore binario. Il che mi porta al numero 2 ...

  2. Supponiamo che i tuoi 6 principali componenti principali abbiano un diagramma di coppia simile a questo

    "Pattern" in coppie.

    Ma coloriamo una risposta binaria arbitraria

    "Pattern" è inutile.

    Anche se sei riuscito a catturare quasi tutto (99%) della varianza in 6 variabili, non sei ancora sicuro di avere una separazione spaziale per prevedere la tua risposta binaria.

Potresti effettivamente aver bisogno di diverse soglie numeriche (che potrebbero essere tracciate come superfici in quello spazio di 6 dimensioni) e l'appartenenza di un punto alla tua classificazione binaria potrebbe dipendere da un'espressione condizionale complessa fatta della relazione di quel punto con ciascuna di quelle soglie. Ma questo è solo un esempio di come una classe binaria potrebbe essere prevista. Esistono moltissime strutture e metodi di dati per rappresentare, formare e prevedere. Questo è un teaser. Per citare,

Spesso la parte più difficile della risoluzione di un problema di apprendimento automatico può essere trovare lo stimatore giusto per il lavoro.


1
Faccina sorridente in realtà è buono, perché è non correlato! Mi è piaciuto.
ameba,

@amoeba, puoi avere una faccina sorridente da PC non correlati?
Aksakal,

@Aksakal, sì, la trama della dispersione di smiley mi sembra che mostri una correlazione zero. Kdbanman, apprezzo l'aggiornamento, +1.
ameba,

@amoeba, ok, vuoi dire correlazione lineare .
Aksakal,
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.