\newcommand{\diag}{\operatorname{diag}} Abbiamo il problema: minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right), presupponendo che: ∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). Esiste una soluzione a forma chiusa in questo caso? Ho questo: (XTX)−1=diag(σ−21,...,σ−2d),(XTX)−1=diag(σ1−2,...,σd−2),(X^TX)^{-1}=\diag\left(\sigma_1^{-2},...,\sigma_d^{-2}\right), e quindi penso che la risposta sia : wj=yjmax{0,1−λn|yj|},wj=yjmax{0,1−λn|yj|},w\,^j=y\,^j\max\left\{0,1-\lambda \frac{n}{|y^j|}\right\}, per yj=∑i=1nyixijσ2iyj=∑i=1nyixijσi2y\,^j=\displaystyle\sum_{i=1}^n\frac{y_ix_i\,^j}{\sigma_i^2} , ma non ne sono sicuro.
Sto per finire i miei onori in statistica e voglio davvero fare un dottorato di ricerca perché trovo le statistiche matematiche estremamente interessanti. Aree di ricerca in cui desidero fare un dottorato sono i processi stocastici e le serie temporali. Tuttavia voglio anche perseguire una carriera nel settore privato dopo …
Mentre leggendo casualmente alcune opere di mercato di massa sulla teoria del caos negli ultimi anni, ho iniziato a chiedermi come possano essere applicati vari aspetti di esso al data mining e ai campi correlati, come reti neurali, riconoscimento dei modelli, gestione dell'incertezza, ecc. Fino ad oggi, I Ho incontrato …
Questa domanda si ispira alla lunga discussione nei commenti qui: in che modo la regressione lineare usa la distribuzione normale? Nel solito modello di regressione lineare, per semplicità qui scritto con un solo predittore: Yi=β0+β1xi+ϵiYi=β0+β1xi+ϵi Y_i = \beta_0 + \beta_1 x_i + \epsilon_i dove xixix_i sono costanti note e ϵiϵi\epsilon_i …
Sto leggendo un commento a un articolo e l'autore afferma che a volte, anche se gli stimatori (rilevati da ML o massima quasilikelihood) potrebbero non essere coerenti, la potenza di un rapporto di verosimiglianza o di un rapporto di quasi verosimiglianza può ancora convergere in 1 poiché il numero di …
Di recente ho incontrato la distribuzione bivariata di Poisson, ma sono un po 'confuso su come possa essere derivato. La distribuzione è data da: P ( X = x , Y = y ) = e - ( θ 1 + θ 2 + θ 0 ) θ x 1x …
Ho appena avuto un attacco di panico (intellettuale). Una variabile casuale continua che segue un'uniforme in un intervallo chiuso U( a , b )U(un',B)U(a,b) : un concetto statistico comodamente familiare. Un camper uniforme continuo con supporto sui reali estesi (metà o intero): non un camper vero e proprio, ma un …
Per variabili casuali , e una matrice semi-definita positiva A : esiste un'espressione semplificata per il valore atteso, E [ T r ( X T A X ) ] e varianza, V a r [ T r ( X T A X ) ] ? Si noti che A non …
La domanda è semplicemente cosa si afferma nel titolo: quando fallisce la legge dei grandi numeri? Quello che voglio dire è, in quali casi la frequenza di un evento non tenderà alla probabilità teorica?
Mi sono recentemente laureato con un master in modellistica medica e biologica, accompagnato da ingegneria matematica come sfondo. Anche se il mio programma educativo includeva una quantità significativa di corsi di statistica matematica (vedi sotto per un elenco), che ho gestito con voti piuttosto alti, finisco spesso per perdere completamente …
Nelle statistiche circolari, il valore di aspettativa di una variabile casuale con valori sul cerchio S è definito come m 1 ( Z ) = ∫ S z P Z ( θ ) d θ (vedi Wikipedia ). Questa è una definizione molto naturale, così come la definizione della varianza …
Diciamo che sto calcolando altezze (in cm) e i numeri devono essere più alti di zero. Ecco l'elenco di esempio: 0.77132064 0.02075195 0.63364823 0.74880388 0.49850701 0.22479665 0.19806286 0.76053071 0.16911084 0.08833981 Mean: 0.41138725956196015 Std: 0.2860541519582141 In questo esempio, secondo la distribuzione normale, il 99,7% dei valori deve essere compreso tra ± …
Considera il modello di regressione lineare y=Xβ+uy=Xβ+u\mathbf{y}=\mathbf{X\beta}+\mathbf{u} , u∼N(0,σ2I)u∼N(0,σ2I)\mathbf{u}\sim N(\mathbf{0},\sigma^2\mathbf{I}) , E(u∣X)=0E(u∣X)=0E(\mathbf{u}\mid\mathbf{X})=\mathbf{0} . Sia vs .H0:σ20=σ2H0:σ02=σ2H_0: \sigma_0^2=\sigma^2H1:σ20≠σ2H1:σ02≠σ2H_1: \sigma_0^2\neq\sigma^2 Possiamo dedurre che , dove . E è la notazione tipica per la matrice annichilatrice, , dove è la variabile dipendente \ mathbf {y} è regredito su \ mathbf {X} .dim(X)=n×kMXMXy= y …
Sto cercando di capire la logica dietro il test chi-quadrato. Il test Chi-quadrato è . χ2viene quindi confrontato con una distribuzione Chi-quadrata per scoprire un valore p al fine di respingere o meno l'ipotesi nulla. H0: le osservazioni provengono dalla distribuzione che abbiamo usato per creare i nostri valori previsti. …
Queste due espressioni mi hanno confuso molto quando stavo imparando le statistiche. Mi sembra che siano cose totalmente diverse. Un campione casuale consiste nel prelevare in modo casuale un campione da una popolazione, mentre una variabile casuale è come una funzione che mappa l'insieme di tutti i possibili risultati di …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.