Ho un set di dati 1000+ campioni di 19 variabili. Il mio obiettivo è prevedere una variabile binaria in base alle altre 18 variabili (binaria e continua). Sono abbastanza fiducioso che 6 delle variabili di previsione siano associate alla risposta binaria, tuttavia, vorrei analizzare ulteriormente il set di dati e cercare altre associazioni o strutture che potrebbero mancare. Per fare ciò, ho deciso di utilizzare PCA e clustering.
Quando si esegue il PCA sui dati normalizzati, risulta che è necessario conservare 11 componenti per mantenere l'85% della varianza.
Tracciando i grafici a coppie ottengo questo:

Non sono sicuro di cosa succederà ... Non vedo alcun modello significativo nel pca e mi chiedo cosa significhi e se ciò potrebbe essere stato causato dal fatto che alcune delle variabili sono binarie. Eseguendo un algoritmo di clustering con 6 cluster ottengo il seguente risultato che non è esattamente un miglioramento, anche se alcuni BLOB sembrano distinguersi (quelli gialli).

Come probabilmente puoi dire, non sono un esperto di PCA, ma ho visto alcuni tutorial e come può essere potente avere una visione delle strutture in uno spazio ad alta dimensione. Con il famoso set di dati delle cifre MNIST (o IRIS) funziona alla grande. La mia domanda è: cosa devo fare ora per dare più senso al PCA? Il clustering non sembra raccogliere nulla di utile, come posso dire che non ci sono pattern nel PCA o cosa dovrei provare dopo per trovare pattern nei dati PCA?


