Qual è il significato delle doppie barre e 2 in basso nei minimi quadrati ordinari?


10

Ho visto questa notazione per i minimi quadrati ordinari qui .

minw‖Xw−y‖22

Non ho mai visto le doppie barre e le 2 in basso. Cosa significano questi simboli? Hanno una terminologia specifica per loro?


5
L'uso delle doppie barre indica semplicemente che stiamo usando la norma L2.
— Michael R. Chernick,

@MichaelChernick e il 2? Fa parte della "norma L2"?
— Aseem Bansal,

1
Sì, come L2, c'è anche L1.
— Jon

Penso che Xw dovrebbe essere Xw poiché w è un vettore
— ilanman,

@ilanman Sì, questo è ciò che era nella notazione prima della modifica. L'ho cambiato di nuovo
— Aseem Bansal il

Risposte:


29

Stai parlando della -norm (norma euclidea) del vettore ( ). Se questo ti è estraneo, brevemente, il -norm di un vettore è:ℓ2Xw−yℓpu∈Rn

‖u‖p=(∑i=1n|ui|p)1p

Quindi nel tuo caso che è coerente con la somma dei residui quadrati per una regressione lineare. Nel contesto dei problemi di regressione, lo vedrai anche molto nei calcoli dell'errore quadratico medio (MSE) e nella regressione della cresta .‖u‖22=((∑i=1n|ui|2)12)2=∑i=1nui2

Questa è una norma comune (tra le altre ragioni, è matematicamente conveniente), quindi quando è ovvio dal contesto, vedrai i inferiori omessi e solo .2‖u‖2

Come menzionato nei commenti, potresti anche vedere -norm:ℓ1

‖u‖1=∑i=1n|ui|

Che corrisponde al valore assoluto. Ancora una volta, vedrai questo in errore assoluto medio (MAE) o problemi lazo .

Altre norme popolari:

  • ℓ0 -norm: distanza di Hamming , o # di non zeri in un vettore, ovvero nel calcolo della sparsità di un vettore. Tecnicamente questa non è una norma (è una funzione di cardinalità), perché nella definizione hai un termine , ma ha la forma di una norma, quindi la chiamiamo una. 10
    • Questa norma è la norma ideale utilizzata nell'indurre la scarsità per i problemi di regressione poiché vogliamo davvero azzerare i coefficienti, tuttavia calcolare la regolarizzazione è NP-difficile, quindi invece la approssimiamo con che è risolvibile tramite la programmazione lineare. È anche popolare nel Sensing compresso .ℓ0ℓ1
  • ℓ∞ -norm: = permaxi {|xi|}i=1,...,n
  • ‖A‖F : norma Frobenius (euclidea), applicata a una matriceA∈Rn×m=∑i=1n∑j=1m|aij|2

2
Il link a wolfram alpha è stato davvero utile.
— Aseem Bansal,

Lei scrive che il (pseudo) norma conta il numero di zeri in un vettore-hai forse dire che il numero di non -Zero voci? (Questo sarebbe più coerente con quello che ho visto, e significherebbe anche che sarebbe la distanza di Hamming tra e , invece di essere meno che distanza.)ℓ0‖u‖0u0∈Rnn
— wchargin

1
Errore di ortografia: "Frobenius".
— Hobbs

1
Invece di "questa è una norma comune" avrei appena detto "L2 è la norma";)
— user541686
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.