Ho due popolazioni, una con N = 38.704 (numero di osservazioni) e l'altra con N = 1.313.662. Questi set di dati hanno ~ 25 variabili, tutte continue. Ho preso la media di ciascuno in ogni set di dati e ho calcolato la statistica del test usando la formula
t = differenza media / errore std
Il problema è il grado di libertà. Con la formula di df = N1 + N2-2 avremo più libertà di quanto la tabella possa gestire. Qualche suggerimento su questo? Come controllare la statistica t qui. So che il test t viene utilizzato per la gestione dei campioni, ma cosa succede se lo applichiamo su campioni di grandi dimensioni.
