Parole comuni che hanno particolari significati statistici


12

Non sono uno statistico, ma il mio lavoro di ricerca prevede statistiche (analisi dei dati, lettura di pubblicazioni, ecc.). Mi è stato nuovamente ricordato da un commento su una delle mie domande pubblicate qui che ci sono alcune parole comuni che hanno significati o connotazioni particolarmente specifici per coloro che sono ben praticati nel campo della statistica.

Sarà utile avere un elenco di tali parole e potrebbero essere frasi insieme ad alcuni commenti.


1
Sembra un candidato per Community Wiki .
Glen_b

@Glen_b Potrebbe trasformarsi in uno particolarmente grande, dato che quasi tutti i termini in statistica o matematica si qualificherebbero. C'è un modo per restringere in modo significativo la portata di questa domanda?
whuber

3
@whuber Sì, c'è il pericolo che diventi eccessivamente ampio. Basterebbe qualcosa come "che comunemente genera confusione" per restringere il campo di applicazione?
Glen_b

Penso che gli statistici competenti normalmente abbiano una buona padronanza della loro lingua madre e siano ben consapevoli di quando usano il gergo che deve essere adeguatamente spiegato a un pubblico laico.
Robert Jones,

@Glen_b Non ne sono sicuro. È così ampio che riesco a malapena a iniziare un elenco di parole che dovrebbero essere coperte: accuratezza, distorsione, calibrazione, discriminazione, continuo, distribuzione, pericolo, sopravvivenza, spline, modello, risposta, bootstrap, regolazione, cluster, condizionale, fiducia, densità , stima, variabile, canonica, correlazione, previsione, inferenza, censura, rischio, concordanza, logistica, limite, copertura, confusione, contingenza, convergenza, corrispondenza, libertà, devianza, esponenziale, estremo, intervallo, normale, drop-in, fittizio , ha spiegato [variazione], fattore, errore, riempimento, adattamento, adattamento, funzione, ...
whuber

Risposte:


12

" significativo " - qui l'uso del linguaggio comune della parola è intendere qualcosa come "importante" o "significativo". Il significato statistico è informalmente più vicino a "si può discernere dalla variazione casuale del nulla"; non significa che la differenza sia abbastanza grande da importare.

Ecco alcuni esempi in cui questa distinzione potrebbe essere stata la causa di un po 'di confusione: 1 2

" parametro " - sembra spesso accadere - in particolare negli esperimenti scientifici - che la parola "parametro" sia usata nel modo in cui uno statistico userebbe la parola "variabile". Wikipedia lo dice così:

Un parametro statistico è un parametro che indicizza una famiglia di distribuzioni di probabilità. Può essere considerata una caratteristica numerica di una popolazione o di un modello

Esempio in cui questo potrebbe essere un problema: 1 - presumibilmente il post che ha portato a questa domanda. (Ne ho visto un altro di recente ma non riesco a individuarlo in questo momento)


11

"Errore" - Nelle statistiche spesso significa qualsiasi deviazione tra un valore osservato e previsto. Nella vita reale significa un errore.


11

Ho trovato un documento arbitrato del 2010 che esamina questa domanda.

Anderson-Cook CM. Gergo nascosto: parole quotidiane con significati specifici della statistica. ICOTS8, Conferenza internazionale sulle statistiche sull'insegnamento, Lubiana, Slovenia, 11-17 luglio 2010.

Il documento è disponibile gratuitamente online , quindi fornisco solo un elenco parziale dei termini di cui l'autore discute:

 confounding, control, factor, independent, random, uniform

10

Mi sono imbattuto nel problema di usare la "falsificazione" come in "falsificare un'ipotesi", mentre altri pensavano che mi stavo riferendo al "inventario dei dati". Anche " polarizzato " è quasi impossibile citare senza causare confusione.


6

"normale" - Nel linguaggio comune, normale significa come previsto, non fuori dal comune. In statistica, se una variabile è normalmente distribuita, si riferisce alla distribuzione gaussiana. Non credo sia normale mettere in maiuscolo la parola "normale" per distinguerla dal significato del linguaggio comune.

"normalizzazione / standaridization" - In statistica, normalizzare una variabile significa sottrarre la media e dividere per la deviazione standard.

"deviazione standard contro errore standard" : la deviazione standard viene generalmente calcolata utilizzando l'intera popolazione, mentre l'errore standard viene calcolato utilizzando il campione.


1
Dubito davvero che "errore standard" sia una "parola comune [convenzionale, non statistica]" con uno speciale significato statistico che differisce dagli altri usi di quella parola (frase, davvero). Idem per "normalizzazione" e "deviazione standard".
whuber

Forse non "normalizzazione", ma "normale" è un buon punto, e quindi sarebbe "standardizzare", che viene anche utilizzato per descrivere test intesi a stabilire standard nazionali (ad esempio, nell'istruzione, come negli Stati Uniti dopo No Child Left Dietro a). Sono d'accordo che è improbabile che la "deviazione standard" causi confusione, sebbene la "deviazione" da sola nel linguaggio comune possa avere maggiori probabilità di avere una connotazione negativa (specialmente come sinonimo di "devianza").
Nick Stauner,

Ecco un altro modo per distinguere SD e SEM. La deviazione standard quantifica la variazione o la dispersione. Un errore standard quantifica la precisione di un valore calcolato.
Harvey Motulsky,

@HarveyMotulsky Penso che il modo migliore sia pensare a un asteroide (forma irregolare). Qual è il centro di massa dell'asteroide? È il punto equidistante da tutti gli altri punti. Questo è il cattivo. Qual è la deviazione standard? È la distanza "media" di ogni punto dal centro, una misura della dimensione. Cos'è il SEM? Ti dice quanto sei sicuro della posizione del centro dell'asteroide.
Pallone

Trovo che dire che l'errore standard è la deviazione standard calcolata usando il "campione" sia un po 'sfortunato. Questa sarebbe la radice quadrata della varianza del campione per me, mentre l'errore standard è la deviazione standard di una statistica di prova. Inoltre, dai termini di cui sopra, solo "normale" sembra molto comune. Ma suppongo sia normale ...
significa significato

2

"Parametrico" rispetto a "Non parametrico": categorie di test che richiedono dati "Normali" o "Non Normali". I test parametrici sono preferiti a quelli non parametrici.

Test comuni: T-test (accoppiato), Mann-Whitney U, ANOVA, Anderson-Darling, ecc.

Altri termini includono "significativo". Questa è una misura se i dati indicano che la tua ipotesi è valida o meno. Quando verifichi la tua ipotesi con un certo grado di probabilità (normalmente il 95%), un "valore p" inferiore a 0,05 indicherebbe che respingerai la tua "ipotesi nulla" (ovvero che i set di dati non sono diversi) e accetti il ​​tuo " ipotesi alternativa "(ovvero i set di dati sono diversi).


2

Inclinato nelle statistiche implica una distribuzione asimmetrica.

Nel linguaggio ordinario, e persino all'interno della scienza, viene spesso usato (e sempre più?) Per indicare ciò che le persone statistiche normalmente chiamerebbero distorte , come in "I risultati per l'altezza media sono distorti includendo così tanti giocatori di basket".


2

Stima : nelle statistiche è il risultato di un calcolo. Ad esempio, la media del campione è una stima della media della popolazione e l'intervallo di confidenza di una media è una stima dell'intervallo della media della popolazione. Questi sono entrambi risultati di calcoli esatti. La "stima" è una generalizzazione precisa del tentativo di fare un'inferenza su una popolazione dai dati di un campione.

Nell'uso ordinario, la parola stima indica un'ipotesi o un'intuizione informata o il risultato di un calcolo approssimativo.


2

θXL(θ|X)=Pr(X|θ)

Rappresentante - ha un certo numero di significati talvolta contrastanti sia nel linguaggio quotidiano che scientifico. Fare riferimento a Kruskal & Mosteller 1979a , 1979b , 1979c e 1980 . La maggior parte degli statistici che conosco considererebbe un campione rappresentativo se fosse campionato con probabilità nota; la maggior parte dei laici che conosco lo considererebbero rappresentativo se le distribuzioni marginali fossero simili alla popolazione.


2
  • Esempio : mentre nelle statistiche si riferisce a una serie di casi , in molte altre discipline un campione è un campione fisico . Naturalmente, anche la dimensione del campione è ambigua, facendo riferimento al numero di casi nel campione statistico o alla dimensione fisica (massa, volume, ...) del campione.

  • Sensibilità : per la diagnostica medica la frazione dei casi di malattia che viene riconosciuta dal test. In chimica analitica: la pendenza della curva di calibrazione (vedi sotto).

  • Specificità : nella diagnostica medica la frazione di casi non patologici è stata correttamente riconosciuta dal test. Nella chimica analitica, un metodo è specifico se non ci sono sensibilità incrociate.

  • Calibrazione : in realtà, due significati sono già elencati per le statistiche nell'articolo Wiki. In chimica e fisica, il significato di regressione inversa è il solito. La confusione sorge però:

    • In chemiometria, la calibrazione (in avanti) modella il segnale misurato base alla concentrazione : . La previsione si risolve quindi per la concentrazione : . Modelli di calibrazione inversa . Pertanto, il modello in avanti concorda con la causalità (la concentrazione dell'analita provoca il segnale, non viceversa), ma il modello inverso indica la direzione utilizzata per le previsioni. (In pratica, è spesso possibile dire che l'errore su o l'errore su è molto più grande dell'altro, e la direzione di modellazione appropriata è / dovrebbe essere scelta da quella)c I = f ( c ) c c = f - 1 ( I ) c = f ( I ) c IIcI=f(c)cc=f1(I)c=f(I)
      cI
    • Ho visto grafici della probabilità prevista rispetto alla probabilità vera chiamata "grafici di calibrazione" (statistiche persone). In chimica analitica, il grafico di calibrazione corrispondente sarebbe la probabilità prevista rispetto al segnale misurato (di solito qualche altra unità). Il diagramma della variabile predetta rispetto alla vera dipendente verrebbe generalmente chiamato curva di recupero .
  • Set di convalida : qui vorrei attirare l'attenzione su un uso potenzialmente confuso di termini che penso già sorgano all'interno dei diversi campi relativi alle statistiche, anche se sono di nuovo in contrasto. Nel contesto della convalida nidificata / doppia o dell'ottimizzazione rispetto alla convalida / test, una riga di terminologia divide l'addestramento - la validazione - il test e utilizza il set di "validazione" per l'ottimizzazione degli iperparametri.
    Ad esempio, in Elements of Statistical Learning, p. 222 nel 2 ° ed. :

    ... dividere il set di dati in tre parti: un set di addestramento, un set di validazione e un set di test. Il set di allenamento viene utilizzato per adattarsi ai modelli; il set di convalida viene utilizzato per stimare l'errore di previsione per la selezione del modello; il set di test viene utilizzato per la valutazione dell'errore di generalizzazione del modello finale scelto.

    Al contrario, ad esempio nella convalida della chimica analitica è la procedura che dimostra che il modello (in realtà, la valutazione del modello finale è solo una parte della convalida di un metodo analitico) funziona bene per l'applicazione e misura le sue prestazioni, vedi ad esempio John K. Taylor: Convalida di metodi analitici, Chimica analitica 1983 55 (6), 600A-608A o linee guida di istituzioni come la FDA. Questo sarebbe "testing" nell'altra linea di terminologia, dove la "validazione" viene effettivamente utilizzata per l'ottimizzazione.
    La differenza cruciale è che i risultati della "validazione dell'ottimizzazione" devono essere usati per cambiare (selezionare) il modello, mentre le modifiche in un metodo analitico validato (incluso il modello analitico dei dati) significano che è necessario riconvalidare (ovvero dimostrare che il metodo funziona ancora come dovrebbe funzionare).


Se ti capita di dover parlare con i chimici, un buon riferimento alla terminologia della chimica analitica è Danzer: Chimica analitica - Fondamenti teorici e metrologici, DOI 10.1007 / b103950

Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.