Come eseguire il test t con campioni enormi?


11

Ho due popolazioni, una con N = 38.704 (numero di osservazioni) e l'altra con N = 1.313.662. Questi set di dati hanno ~ 25 variabili, tutte continue. Ho preso la media di ciascuno in ogni set di dati e ho calcolato la statistica del test usando la formula

t = differenza media / errore std

Il problema è il grado di libertà. Con la formula di df = N1 + N2-2 avremo più libertà di quanto la tabella possa gestire. Qualche suggerimento su questo? Come controllare la statistica t qui. So che il test t viene utilizzato per la gestione dei campioni, ma cosa succede se lo applichiamo su campioni di grandi dimensioni.

Risposte:


20

chl ha già menzionato la trappola di confronti multipli durante l'esecuzione simultanea di 25 test con lo stesso set di dati. Un modo semplice per gestire è quello di regolare la soglia del valore p dividendoli per il numero di test (in questo caso 25). La formula più precisa è: Valore p corretto = 1 - (1 - valore p) ^ (1 / n). Tuttavia, le due diverse formule derivano quasi lo stesso valore p corretto.

C'è un altro grosso problema con il tuo esercizio di test delle ipotesi. Incontrerai sicuramente un errore di tipo I (falso positivo) in base al quale scoprirai alcune differenze davvero insignificanti che sono estremamente significative a livello del 99,9999%. Questo perché quando si ha a che fare con un campione di dimensioni così grandi (n = 1.313.662), si otterrà un errore standard molto vicino a 0. Questo perché la radice quadrata di 1.313.662 = 1.146. Quindi, dividerai la deviazione standard per 1.146. In breve, acquisirai piccole differenze che potrebbero essere completamente irrilevanti.

Suggerirei di abbandonare questo quadro di verifica delle ipotesi e di condurre invece un'analisi del tipo di dimensione dell'effetto. In questo quadro la misura della distanza statistica è la deviazione standard. A differenza dell'errore standard, la deviazione standard non viene ridotta artificialmente dalla dimensione del campione. Inoltre, questo approccio ti darà un migliore senso delle differenze materiali tra i tuoi set di dati. La dimensione dell'effetto è anche molto più focalizzata sull'intervallo di confidenza attorno alla differenza media media che è molto più istruttiva rispetto al test di ipotesi focalizzato sulla significatività statistica che spesso non è affatto significativa. Spero che aiuti.


4
+1 per mettere in evidenza le idee chiave: (1) possiamo garantire che i mezzi differiranno quando le serie di dati sono così grandi e (2) alcune altre analisi saranno probabilmente più appropriate e utili. Ma poiché non conosciamo lo scopo dell'analisi, dovremmo essere cauti nel formulare raccomandazioni specifiche.
whuber

Grazie Gaetan ... hai capito ... Penso che ciò che tolgo da questo è che la deviazione standard è una misura migliore quando hai campioni di grandi dimensioni come il mio ... per favore fammi sapere se ho perso qualcosa.
Ayush Biyani,

1
ayush ... hai ragione. Questo è fondamentalmente. E questo perché l'errore standard diventerà così piccolo (a causa delle grandi dimensioni del campione). Questo a sua volta sopravvaluta la distanza statistica tra i gruppi di test e di controllo. E, alla fine, ti imbatti in un errore di tipo I (scopri una differenza così piccola da essere irrilevante). Questo è un problema comune nel test di ipotesi con campioni di grandi dimensioni.
Sympa,

14

La distribuzione t dello studente diventa sempre più vicina alla distribuzione normale standard man mano che i gradi di libertà diventano più grandi. Con 1313662 + 38704 - 2 = 1352364 gradi di libertà, la distribuzione t sarà indistinguibile dalla distribuzione normale standard, come si può vedere nella figura qui sotto (a meno che forse non sei nelle code molto estreme e ti interessi distinguendo valori p assolutamente minuscoli da valori ancora più piccoli). Quindi è possibile utilizzare la tabella per la distribuzione normale standard anziché la tabella per la distribuzione t .

testo alternativo


Ragazzi, grazie per la risposta. Ho un dato da analizzare. Come allego dati a questo. Molto da chiedere a voi ... Grazie in anticipo. In attesa di una pronta risposta.
Ayush Biyani,

4
Eh? Hai detto nella domanda che avevi già calcolato la statistica t e chl ha fornito il codice R di esempio. Che cosa vuoi di più? A proposito, non sono sicuro che tu abbia il diritto di aspettarti o richiedere una risposta rapida; non siamo pagati per questo lo sai.
onestop,

1
@ayush Per la tua domanda precedente, fornisco una risposta completa alla tua domanda (IMHO) - quindi ho dato un seguito ai tuoi commenti prima di fermarmi quando pensavo che stessi facendo un'altra domanda che non è lo scopo dell'opzione di commento qui . Quindi, suggerirei che tu dichiari chiaramente se la tua domanda riguarda la considerazione teorica o l'analisi dei dati applicati (in quest'ultimo caso, forniscici un esempio riproducibile) o separa le tue domande. A proposito, hai ancora la possibilità di accettare le risposte che ritieni utili (di nuovo, scrivi la tua domanda originale, non i commenti che seguono).
chl

2
@ayush Ah, e mi rendo conto che non hai mai votato nessuna delle risposte che ti sono state fornite (anche se hai abbastanza rappresentante ora).
chl

@ chl-- yeah..anche mi rendo conto di questo mio errore e lo risolverò di sicuro nei post a venire..Grazie di averlo segnalato .. Considerami per alcuni giorni un ingenuo dilettante ..
ayush biyani

10

tznn>30nz

Solo per essere sicuri, dato che il tuo set di dati include 25 variabili, stai facendo 25 test? In questo caso, probabilmente dovrai correggere più confronti in modo da non gonfiare il tasso di errore di tipo I (vedi il thread correlato su questo sito).

A proposito, il software R ti darebbe i valori p che stai cercando, senza bisogno di fare affidamento sulle tabelle:

> x1 <- rnorm(n=38704)
> x2 <- rnorm(n=1313662, mean=.1)
> t.test(x1, x2, var.equal=TRUE)

    Two Sample t-test

data:  x1 and x2 
t = -17.9156, df = 1352364, p-value < 2.2e-16
alternative hypothesis: true difference in means is not equal to 0 
95 percent confidence interval:
 -0.1024183 -0.0822190 
sample estimates:
  mean of x   mean of y 
0.007137404 0.099456039 
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.