Modello di campionamento per dati crowdsourcing?


18

Sto lavorando a un'applicazione di indagine sanitaria aperta, pianificata per essere utilizzata nei paesi in via di sviluppo.

L'idea di base è che le interviste al sondaggio sono in crowdsourcing : sono eseguite da volontari non organizzati che inviano i dati dei moduli delle interviste che hanno effettuato utilizzando i loro dispositivi mobili e ogni sondaggio è accompagnato dai dati GPS del luogo del colloquio.

I sondaggi tradizionali compilati dalle agenzie governative sono di solito implementati utilizzando un modello di campionamento standard, di solito un modello di campionamento di probabilità. Ciò richiede molta pianificazione centralizzata che non può essere sempre eseguita. (menzionato per mettere la mia domanda nel giusto contesto)

Possiamo dire che un volontario realizzerà un campionamento di convenienza nella sua area. Intervisterà arbitrariamente il numero di persone che può raggiungere.

Il problema di base è: come è possibile comprendere e caratterizzare il modello di campionamento generale di questo sistema di rilevamento? Esistono metodologie o modelli composti per affrontare tali casi?

Risposte:


15

Risposta breve: questo è un esempio di convenienza. Non c'è niente che tu possa fare per giustificarlo.

Una risposta un po 'più lunga: sei nella stessa barca di molti social network che eseguono i loro sondaggi interni senza avere molta idea di chi risponderebbe a un sondaggio di una domanda che apparirebbe a caso su Facebook o Google + ... tranne che a differenza di questi giganti, tu non non hanno dati su coloro che non hanno risposto. Il sondaggio e la comunità di ricerca dell'opinione pubblica generalmente disapprovano questo tipo di lavoro, poiché non è affatto chiaro come i risultati di questo campione fortemente distorto possano essere generalizzati alla popolazione totale (se non del tutto). Puoi provare a ripesare in base ai dati demografici conosciuti, ma poi finirai con una variazione di pesi da 1 per una persona che si rappresentano solo a 1.000.000 assegnati all'unico maschio di oltre 70 nella popolazione che sa come usare un computer (e probabilmente non è rappresentativo dei restanti 1.000.000 70+ maschi).

Letture addizionali: "Come mentire con le statistiche" si apre con un capitolo su esempi distorti. Se riesci a leggerlo e non piangere frustrato per il tuo progetto di esempio, puoi andare avanti. Se fai affidamento su volontari, il tuo campione sarà orientato verso le popolazioni giovani e urbane con un migliore accesso ai gadget elettronici. Allo stesso modo, l' opuscolo "What is a Survey" messo insieme da Fritz Scheuren, ex presidente dell'American Statistical Association, si apre con il ritratto di Harry Truman la cui vittoria non avrebbe potuto essere prevista dalle tecniche di sondaggio di parte esistenti all'epoca.

C'è qualche ricerca su popolazioni difficili da raggiungere . Un progetto ben noto è stato uno studio sul numero di morti in eccesso in Iraq, dove sono state campionate le aree geografiche, e in ogni area, il medico locale avrebbe cercato di sollecitare interviste da ogni famiglia nell'isolato. C'è stata una critica crescente di questo design, ma per quanto compromettente fosse, aveva ancora il suo componente di campionamento. Vedi articoli su Lancet (come probabilmente saprai, non puoi diventare più prestigioso nel mondo medico) http://dx.doi.org/10.1016/S0140-6736(04)17441-2 e http: //dx.doi .org / 10.1016 / S0140-6736 (06) 69491-9 .


(+1) Stas, c'è qualcosa di fondamentalmente diverso qui dal campionamento delle quote ? Solo curioso, una lettura superficiale della domanda fa sembrare solo un cambiamento nella terminologia. Inoltre, in breve, quali sono le principali critiche dello studio sul campionamento dei cluster iracheni? Ricordo di averlo visto quando è uscito per la prima volta e di averlo letto un po '.
cardinale il

Suppongo che una differenza sia che non esiste una quota per individuo ...;)
cardinale il

Grazie mille! Ora, ho una buona comprensione prima di riprogettare l'idea!
al-Amjad Tawfiq Isstaif,


Penso che ci siano stati problemi con il piccolo numero di cluster e un cluster che si è rivelato un valore anomalo in cui l'attività militare era molto più elevata che in qualsiasi altra parte del paese. Per me, la prima cosa da guardare sarebbero le dichiarazioni AAPOR e ASA sullo studio. Mentre Lancet potrebbe essere un grande diario medico, e John Hopkins, un grande medico, che fiutava l'autorità AAPOR e negava loro che i documenti metodologici erano poco professionali.
StasK
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.