Perché viene spesso assunta la distribuzione gaussiana?


13

Citando un articolo di Wikipedia sulla stima dei parametri per un classificatore Bayes ingenuo : "un presupposto tipico è che i valori continui associati a ciascuna classe sono distribuiti secondo una distribuzione gaussiana".

Capisco che una distribuzione gaussiana è conveniente per ragioni analitiche. Tuttavia, c'è qualche altra ragione nel mondo reale per fare questa supposizione? E se la popolazione fosse composta da due sottopopolazioni (persone intelligenti / stupide, mele grandi / piccole)?


5
Forse a causa del teorema del limite centrale, le distribuzioni gaussiane si adattano a molte, sebbene non tutte, misure di fenomeni fisici? Con sotto-popolazioni, si può ottenere la miscela distribuzioni gaussiane.
Dilip Sarwate,

1
La stessa sezione (suppongo che tu stia guardando l'articolo di Naive Bayes) sottolinea che il binning è probabilmente un'idea migliore se non conosci la distribuzione. Qualcuno dovrebbe probabilmente modificare l'articolo di Wikipedia per rendere più chiaro che si dovrebbe assumere gaussiano solo se può argomentare perché è gaussiano (ad esempio, tracciare i dati o seguire il modello additivo del CLT).
rm999

Risposte:


6

Almeno per me, il presupposto della normalità deriva da due (molto potenti) motivi:

  1. Il teorema del limite centrale.

  2. La distribuzione gaussiana è una distribuzione di entropia massima (rispetto alla versione continua dell'entropia di Shannon).

Penso che tu sia a conoscenza del primo punto: se il tuo campione è la somma di molte proiezioni, quindi finché sono soddisfatte alcune condizioni lievi, la distribuzione è praticamente gaussiana (ci sono generalizzazioni del CLT dove in realtà non lo fai deve presumere che i camper della somma siano distribuiti in modo identico, vedi, ad esempio, il Lyapunov CLT).

Il secondo punto è quello che per alcune persone (specialmente i fisici) ha più senso: dati il ​​primo e il secondo momento di una distribuzione, la distribuzione che assume meno informazioni (ovvero il più conservativo) rispetto alla misura di entropia continua di Shannon (che è alquanto arbitrario sul caso continuo, ma, almeno per me, totalmente obiettivo nel caso discreto, ma questa è un'altra storia), è la distribuzione gaussiana. Questa è una forma del cosiddetto "principio dell'entropia massima", che non è così diffusa perché l'uso effettivo della forma dell'entropia è in qualche modo arbitrario (vedere questo articolo di Wikipedia per ulteriori informazioni su questa misura ).

μΣ

PD: Devo aggiungere al principio della massima entropia che, secondo questo documento , se ti capita di conoscere l'intervallo di variazione della tua variabile, devi apportare modifiche alla distribuzione che ottieni dal principio della massima entropia.


3

La mia risposta è d'accordo con il primo soccorritore. Il teorema del limite centrale ti dice che se la tua statistica è una somma o media sarà approssimativamente normale in determinate condizioni tecniche indipendentemente dalla distribuzione dei singoli campioni. Ma hai ragione che a volte le persone lo portano troppo lontano solo perché sembra conveniente. Se la tua statistica è un rapporto e il denominatore può essere zero o vicino ad esso, il rapporto sarà troppo pesante per il normale. Gosset ha scoperto che anche quando si campiona da una distribuzione normale una media normalizzata in cui viene utilizzata la deviazione standard del campione per la costante di normalizzazione, la distribuzione è la distribuzione t con n-1 gradi di libertà quando n è la dimensione del campione. Nei suoi esperimenti sul campo presso il birrificio Guiness ha campioni di dimensioni che potrebbero essere comprese tra 5 e 10. In quei casi la distribuzione t è simile alla distribuzione normale standard in quanto è simmetrica circa 0 ma ha code molto più pesanti. Si noti che la distribuzione t converge allo standard normale man mano che n diventa grande. In molti casi la distribuzione che hai potrebbe essere bimodale in quanto è una miscela di due popolazioni. Alcune volte queste distribuzioni possono essere adattate come una miscela di distribuzioni normali. Ma non sembrano certo una distribuzione normale. Se guardi un manuale di statistiche di base troverai molte distribuzioni parametriche continue e discrete che spesso sorgono in problemi di inferenza. Per i dati discreti abbiamo il binomio binomiale, di Poisson, geometrico, ipergeometrico e negativo per citarne alcuni. Esempi continui includono il chi quadrato, lognormale, Cauchy, esponenziale negativo, Weibull e Gumbel.


2

L'uso del CLT per giustificare l'uso della distribuzione gaussiana è un errore comune perché il CLT viene applicato alla media del campione, non alle singole osservazioni. Pertanto, aumentare le dimensioni del campione non significa che il campione sia più vicino alla normalità.

La distribuzione gaussiana è comunemente usata perché:

  1. La stima della massima verosimiglianza è semplice.
  2. L'inferenza bayesiana è semplice (usando priori coniugati o priori di tipo Jeffreys).
  3. È implementato nella maggior parte dei pacchetti numerici.
  4. C'è molta teoria su questa distribuzione in termini di test di ipotesi.
  5. Mancanza di conoscenza di altre opzioni (più flessibile). ...

Ovviamente, l'opzione migliore è usare una distribuzione che tenga conto delle caratteristiche del tuo contesto, ma questo può essere impegnativo. Tuttavia, è qualcosa che le persone dovrebbero fare

"Tutto dovrebbe essere reso il più semplice possibile, ma non più semplice." (Albert Einstein)

Spero che questo possa essere d'aiuto.

Auguri.


Perché il downvote? quale argomento secondario è per questa spiegazione?
lmsasu,

4
La convinzione che "L'uso del CLT per giustificare l'uso della distribuzione gaussiana è un errore comune perché il CLT viene applicato alla media del campione" è esso stesso un errore. Ad esempio, gli elettroni in un conduttore si muovono a caso. La piccola carica su ciascun elettrone contribuisce a una tensione di rumore netta (chiamata rumore termico) che può essere misurata attraverso i terminali del conduttore. Ogni contributo è piccolo, ci sono molti elettroni e quindi tramite il CLT, il rumore è modellato come un processo casuale gaussiano. Questo modello è stato validato in numerosi studi sperimentali.
Dilip Sarwate,

1
Questo primo paragrafo è confuso e sembra fuori tema. Quando si applica il CLT spesso si dice che una distribuzione è gaussiana perché ogni singola osservazione è la somma / media di molti processi. Se il primo paragrafo venisse rimosso, penso che sarebbe una buona risposta.
rm999

1
@ rm999 "Se il primo paragrafo fosse rimosso penso che sarebbe una buona risposta". In realtà, il primo paragrafo è il punto cruciale della risposta poiché il resto indica semplicemente come il modello gaussiano sia analiticamente utile - cosa che l'OP già comprende - e non risponde alla domanda posta.
Dilip Sarwate,

@Dilip: (+1) Il kernel di una risposta molto buona è presente nel tuo primo commento. Si prega di considerare di espanderlo in un post separato.
cardinale
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.