Perché studiare la regressione lineare?


13

Date due variabili casuali e η , possiamo calcolare il loro "coefficiente di correlazione" c e formare la linea di adattamento migliore tra queste due variabili casuali. La mia domanda è: perché?ξηc

1) Esistono variabili casuali, e η che dipendono nel modo peggiore possibile, cioè ξ = f ( η ) e nonostante ciò c = 0 . Se si pensa solo alla regressione lineare, si sarebbe totalmente accecati da questo.ξηξ=f(η)c=0

2) Perché specificamente lineare? Esistono altri tipi di relazioni che possono esistere tra variabili casuali. Perché scegliere quello tra tutti gli altri?


18
È un po 'come chiedere perché possiedi un cacciavite quando a volte incontri dei chiodi.
Sycorax dice di reintegrare Monica il

6
Sembra anche che tu stia assumendo la premessa che ci sono persone là fuori che si preoccupano solo della regressione lineare: "Se uno pensa solo lungo la regressione lineare", "Perché scegliere quello tra tutti gli altri ". Mi sembra un pagliaccio, ovviamente è ridicolo aderire a un solo strumento o prospettiva.
Matthew Drury,

7
La "specificità" lineare riguarda in realtà più combinazioni lineari di funzioni di base , che in realtà sono piuttosto generali.
GeoMatt22,

2
@MatthewDrury Non c'è pagliaccio, e non sto assumendo nulla, sto semplicemente facendo una domanda usando un caso patologico-estremo di pensiero per illustrare un punto debole del metodo. Perché pensi che io lo supponga? La regressione è un argomento molto vasto per gli statistici. Non capisco cosa ci sia di così speciale da essere studiato così tanto.
Nicolas Bourbaki,

8
Per coloro che stanno scendendo con forza su questa domanda: penso che ti sei dimenticato quando hai appreso per la prima volta la regressione lineare e ti è stato detto che "uno dei presupposti è quello di un effetto lineare". Hai pensato a te stesso "ma un effetto non è mai lineare!". Molto probabilmente, dopo molte riflessioni, ti sei convinto che, nonostante ciò, la regressione lineare era ancora uno strumento fondamentale da comprendere e utilizzare. Ora ripristina solo te stesso prima di aver completato quella riflessione. Penso che sia una grande domanda che ogni studente di statistiche dovrebbe dedicare molto tempo a considerare.
Cliff AB,

Risposte:


9

Sono d'accordo che non tutte le relazioni sono lineari in sé, ma molte relazioni possono essere approssimate linearmente. Abbiamo visto molti di questi casi in matematica come la serie Taylor o la serie di Fourier ecc. Il punto chiave qui è, ha detto geomatt22 nel commento, in generale puoi trasformare i dati non lineari e applicare un qualche tipo di trasformazione con funzioni di base e linearizzare il relazione. Il motivo per cui le università affrontano solo i "modelli di regressione lineare multipla" (compresi i modelli di regressione semplice) è perché sono la base per i modelli di livello più avanzato che sono anche lineari.

Matematicamente parlando, finché puoi dimostrare che una certa approssimazione lineare è densa in uno spazio di Hilbert, allora sarai in grado di usare l'approssimazione per rappresentare una funzione nello spazio.


2
Esattamente. Nessun altro lo ha menzionato, ma come dice questa risposta, in generale, puoi sempre applicare una trasformazione alle tue variabili per linearizzare la relazione. Inoltre: a) è facile trovare i massimi globali per le regressioni lineari eb) molti altri modelli, comprese le reti neurali, sono più facili da capire se si conoscono regressioni logistiche basate su regressioni lineari.
Ricardo Cruz,

7

Il modello a cui ti riferisci, semplice regressione lineare, noto anche come "la linea della migliore misura" (qui confondo il modello e il metodo di stima), è certamente molto semplice (come dice il nome). Perché studiarlo? Vedo molte ragioni. Nel seguito presumo che il concetto di variabile casuale sia stato introdotto almeno in modo informale, perché lo hai menzionato nella tua domanda.

  1. pedagogica: ovviamente per te è ovvio che variabili casuali a valore reale con momenti finiti del secondo ordine formano uno spazio di Hilbert. Forse era già ovvio quando hai studiato la teoria della probabilità. Ma la statistica non è solo insegnata agli studenti di matematica: c'è un pubblico più ampio, dalla fisica all'economia, all'informatica, alle scienze sociali, ecc. Questi studenti possono incontrare le statistiche all'inizio del loro corso di studi. Potrebbero o meno essere stati espulsi all'algebra lineare e, anche nel primo caso, potrebbero non averlo visto dal punto di vista più astratto di un corso di matematica. Per questi studenti, il concetto stesso di approssimare una variabile casuale con un'altra variabile casuale non è così immediato. Anche la proprietà di base del modello lineare semplice, ovvero il fatto che l'errore e il predittore sono variabili casuali ortogonali, a volte è sorprendente per loro. Il fatto che tu possa definire un "angolo" tra variabili casuali (oggetti "cattivi"! Funzioni misurabili da uno spazio di probabilità a uno spazio misurabile) può essere ovvio per te, ma non necessariamente per una matricola. Quindi, se lo studio degli spazi vettoriali inizia con il buon vecchio piano euclideo, non ha senso iniziare lo studio di modelli statistici con il più semplice?
  2. ξ=β0+i=1Nβiηi+ϵξ=i=0Nβiϕ(ηi)+ϵ
  3. pratico : esistono numerose applicazioni di successo di semplice regressione lineare. La legge di Okun in economia, legge di Hooke , legge di Ohm e la legge di Charles in fisica, il rapporto tra la pressione sanguigna sistolica e l'età in medicina (non ho idea se ha un nome!) Sono tutti esempi di regressione lineare semplice, con vari gradi di precisione.

4

Un ulteriore motivo è il modo adorabile in cui la regressione offre un trattamento unificato di tecniche come ANOVA. Per me, il solito trattamento "elementare" di ANOVA sembra abbastanza oscuro, eppure un trattamento basato sulla regressione è cristallino. Sospetto che ciò abbia molto a che fare con il modo in cui i modelli di regressione rendono esplicite alcune ipotesi che nei trattamenti "elementari" siano taciti e non esaminati. Inoltre, la chiarezza concettuale offerta da una tale prospettiva unificante è accompagnata da vantaggi pratici simili quando arriva il momento di implementare metodi nel software statistico.

Questo principio si applica non solo all'ANOVA, ma alle estensioni come le spline cubiche con restrizioni, che riguardano in particolare la seconda domanda.


3

La popolarità della regressione lineare è in parte dovuta alla sua interpretabilità, ovvero le persone non tecniche possono comprendere i coefficienti dei parametri con solo un po 'di spiegazione. Ciò aggiunge un grande valore in situazioni aziendali, in cui gli utenti finali dell'output o delle previsioni potrebbero non avere una conoscenza approfondita della matematica / delle statistiche.

Sì, ci sono ipotesi e limitazioni con questa tecnica (come con tutti gli approcci) e potrebbe non fornire la soluzione migliore in molti casi. Ma la regressione lineare è molto robusta e spesso può funzionare abbastanza bene anche quando vengono violate le ipotesi.

Per questi motivi, vale sicuramente la pena studiare.


-2

Qualcosa potrebbe non essere direttamente correlato.

Se hai due serie X e y quello cov(X,y)=0e se sospetti che ci siano relazioni tra X e y. Potresti fare una trama tray e X per esaminare la loro relazione.

Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.