Ho bisogno di alcune indicazioni sul livello appropriato di pooling da utilizzare per i test delle differenze di mezzi sui dati delle serie temporali. Sono preoccupato per la pseudo-replicazione temporale e sacrificale, che sembra essere in tensione su questa applicazione. Questo è in riferimento a uno studio mensurale piuttosto che a un esperimento manipolativo.
Prendi in considerazione un esercizio di monitoraggio : un sistema di sensori misura il contenuto di ossigeno disciolto (DO) in molti punti attraverso la larghezza e la profondità di uno stagno. Le misurazioni per ciascun sensore vengono registrate due volte al giorno, poiché è noto che DO varia diurno. I due valori sono mediati per registrare un valore giornaliero. Una volta alla settimana, i risultati giornalieri vengono aggregati spazialmente per arrivare a una singola concentrazione settimanale di DO per l'intero stagno.
Tali risultati settimanali vengono comunicati periodicamente e ulteriormente aggregati: viene calcolata la media dei risultati settimanali per fornire una concentrazione DO mensile per lo stagno. I risultati mensili sono mediati per dare un valore annuale. Le medie annuali sono esse stesse mediate per riportare concentrazioni decadali di DO per lo stagno.
L'obiettivo è rispondere a domande come: la concentrazione DO del laghetto nell'anno X era più alta, più bassa o uguale alla concentrazione nell'anno Y? La concentrazione media di DO negli ultimi dieci anni è diversa da quella del decennio precedente? Le concentrazioni di DO in uno stagno rispondono a molti input di grande entità e quindi variano considerevolmente. È necessario un test di significatività. Il metodo consiste nell'utilizzare un confronto T-test dei mezzi. Dato che i valori decadali sono la media dei valori annuali e i valori annuali sono la media dei valori mensili, questo sembra appropriato.
Ecco la domanda : puoi calcolare le medie decadali e i valori T di tali medie dai valori DO mensili o dai valori DO annuali. La media non cambia ovviamente, ma la larghezza dell'intervallo di confidenza e il valore T cambiano. A causa dell'ordine di grandezza maggiore di N ottenuto utilizzando valori mensili, l'IC spesso si restringe considerevolmente se si procede su questa rotta. Questo può dare la conclusione opposta rispetto all'utilizzo dei valori annuali rispetto alla significatività statistica di una differenza osservata nei mezzi, usando lo stesso test sugli stessi dati. Qual è la corretta interpretazione di questa discrepanza?
Se si utilizzano i risultati mensili per calcolare le statistiche del test per una differenza nelle medie decadali, si sta verificando una pseudoriplicazione temporale? Se usi i risultati annuali per calcolare i test decadali, stai sacrificando informazioni e quindi pseudoreplicando?