Come interpretare i caricamenti di PCA?


13

Durante la lettura di PCA, ho trovato la seguente spiegazione:

Supponiamo di avere un set di dati in cui ciascun punto di dati rappresenta i punteggi di un singolo studente in un test di matematica, un test di fisica, un test di comprensione della lettura e un test del vocabolario.

Troviamo i primi due componenti principali, che catturano il 90% della variabilità dei dati e ne interpretano i caricamenti. Concludiamo che la prima componente principale rappresenta l'abilità accademica generale e la seconda rappresenta un contrasto tra capacità quantitativa e capacità verbale.

Il testo afferma che i caricamenti di PC1 e PC2 sono per PC1 e ( 0,5 , 0,5 , - 0,5 , - 0,5 ) per PC2 e offre la seguente spiegazione:(0.5,0.5,0.5,0.5)(0.5,0.5,0.5,0.5)

[T] il primo componente è proporzionale al punteggio medio e il secondo componente misura la differenza tra la prima coppia di punteggi e la seconda coppia di punteggi.

Non riesco a capire cosa significhi questa spiegazione.


7
In qualche modo la risposta di @ ttnphns va in molti dettagli matematici, ma penso che la domanda originale fosse davvero semplice: perché il vettore dei caricamenti per PC1 di (0,5, 0,5, 0,5, 0,5) significa che il primo componente è "proporzionale al punteggio medio "? Bene, la risposta è che i carichi sono coefficienti [proporzionali ai] in combinazione lineare di variabili originali che compongono PC1. Quindi il tuo primo PC1 è la somma di tutte e quattro le variabili per 0,5. Ciò significa che è proporzionale alla media delle quattro variabili. E simile con PC2. Penso che questo risponda alla domanda originale.
ameba dice Ripristina Monica il

@amoeba - Sai quanto sia difficile trovare una spiegazione così semplice dei caricamenti. In qualche modo, ovunque è una boccata di gergo bile su di me prima di decidere di passare alla prossima spiegazione su google. Grazie!
MiloMinderbinder,

Risposte:


13

I caricamenti (che non devono essere confusi con gli autovettori) hanno le seguenti proprietà:

  1. Le loro somme di quadrati all'interno di ciascun componente sono gli autovalori (varianze dei componenti).
  2. I carichi sono coefficienti in combinazione lineare che prevedono una variabile per i componenti (standardizzati).

Hai estratto 2 primi PC su 4. Matrice dei caricamenti e degli autovalori:A

A (loadings)
         PC1           PC2
X1   .5000000000   .5000000000 
X2   .5000000000   .5000000000 
X3   .5000000000  -.5000000000 
X4   .5000000000  -.5000000000
Eigenvalues:
    1.0000000000  1.0000000000

In questo caso, entrambi gli autovalori sono uguali. È un caso raro nel mondo reale, dice che PC1 e PC2 hanno la stessa "forza" esplicativa.

Supponiamo di aver calcolato anche i valori dei componenti, la Nx2matrice e di averli standardizzati z (media = 0, dev. St = 1) all'interno di ciascuna colonna. Poi (come punto 2 dice), X = C A ' . Ma, perché hai lasciato solo 2 PC su 4 (ti manca altre 2 colonne in A ) i valori dei dati restaurato XCX^=CAAX^ non sono esatti, - c'è un errore (se autovalori 3, 4 non sono zero).

OK. Quali sono i coefficienti per prevedere i componenti per variabili ? Chiaramente, se fosse pieno , questi sarebbero B = ( A - 1 ) . Con una matrice di caricamento non quadrata, possiamo calcolarli come B = A d i a g ( e i g e n v a l u e s ) - 1 = ( A + ) è la matrice quadrata diagonale con gli autovalori su è diagonale eA4x4B=(A1)B=Adiag(eigenvalues)1=(A+) , dovediag(eigenvalues)+apice indica pseudoinverso. Nel tuo caso:

diag(eigenvalues):
1 0
0 1

B (coefficients to predict components by original variables):
    PC1           PC2
X1 .5000000000   .5000000000 
X2 .5000000000   .5000000000 
X3 .5000000000  -.5000000000 
X4 .5000000000  -.5000000000

Quindi, se è una matrice di variabili centrate originali (o variabili standardizzate, se si sta eseguendo PCA in base a correlazioni anziché a covarianze), allora C = X B ; C sono punteggi dei componenti principali standardizzati. Quale nel tuo esempio è:XNx4C=XBC

PC1 = 0,5 * X1 + 0,5 * X2 + 0,5 * X3 + 0,5 * X4 ~ (X1 + X2 + X3 + X4) / 4

"il primo componente è proporzionale al punteggio medio"

PC2 = 0,5 * X1 + 0,5 * X2 - 0,5 * X3 - 0,5 * X4 = (0,5 * X1 + 0,5 * X2) - (0,5 * X3 + 0,5 * X4)

"il secondo componente misura la differenza tra la prima coppia di punteggi e la seconda coppia di punteggi"

B=A


B=Adiag(eigenvalues)1B=R1ARessendo la matrice di covarianza (o correlazione) delle variabili. Quest'ultima formula deriva direttamente dalla teoria della regressione lineare. Le due formule sono equivalenti solo nel contesto PCA. Nell'analisi fattoriale non lo sono e per calcolare i punteggi dei fattori (che sono sempre approssimativi in ​​FA) si dovrebbe fare affidamento sulla seconda formula.


Risposte correlate mie:

Più dettagliato sui caricamenti rispetto agli autovettori .

Come vengono calcolati i punteggi dei componenti principali e i punteggi dei fattori .


2
Se 2 componenti su 4 rappresentano il 90% della variabilità, come mai i loro autovalori si sommano a 2?
Nick Cox,

Nick, credo che questa sia una domanda all'OP. Non ha fornito i dati o la matrice di covarianza / correlazione. Tutto ciò che abbiamo avuto da lui è una matrice di caricamento (piuttosto non realistica) di 2 primi PC.
ttnphns,

3
4×44150%90%
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.