Una ricerca in griglia SVM dovrebbe mostrare una regione ad alta precisione con basse accuratezze in giro?


12

Ho 12 set di allenamento positivi (cellule tumorali trattate con farmaci con ciascuno dei 12 diversi meccanismi d'azione). Per ognuna di queste serie di addestramento positivo, vorrei formare una macchina di supporto vettoriale per distinguerla da una serie negativa di uguale dimensione campionata dall'esperimento. Ogni set ha tra 1000 e 6000 celle e ci sono 476 caratteristiche (caratteristiche dell'immagine) di ogni cella, ciascuna ridimensionata linearmente su [0, 1].

Uso LIBSVM e il kernel RGB gaussiano. Usando cinque volte la crossvalidation, ho fatto una ricerca in griglia per log₂ C ∈ [-5, 15] e log₂ ɣ ∈ [-15, 3]. I risultati sono i seguenti:

Risultati della ricerca della griglia

Sono rimasto deluso dal fatto che non esiste un unico set di parametri che fornisca un'elevata precisione per tutti e 12 i problemi di classificazione. Sono stato anche sorpreso dal fatto che le griglie generalmente non mostrano una regione ad alta precisione circondata da precisioni inferiori. Significa solo che ho bisogno di espandere lo spazio dei parametri di ricerca o la ricerca in griglia indica che c'è qualcos'altro che non va?


2
Re delusione: Non ci si aspetterebbe ogni problema di avere gli stessi parametri, quindi perché dovrebbe aspettare i problemi al valore delle azioni buone per i iperparametri (Log Gamma e C)?
conjugateprior

@Conjugate Priore: i set di addestramento sono sottoinsiemi dello stesso esperimento e i set di addestramento negativo sono campionati dalla stessa popolazione, quindi avevo sperato che la stessa larghezza del kernel RBF ɣ sarebbe stata efficace. Poiché i set positivi vengono discriminati dalla stessa popolazione (negativa), avevo sperato che anche la penalità ideale C fosse simile. In caso contrario, SVM è davvero difficile da applicare. Il potenziamento delicato, ad esempio, sembra molto più facile da regolare.
Vebjorn Ljosa,

Aha. Ma mi sembra che sebbene sia lo stesso esperimento in senso fisico, stai comunque attaccando problemi separati e diversi in senso statistico. In particolare se i casi negativi vengono ricampionati per ciascun trattamento.
conjugateprior

1
A proposito, la ricerca della griglia è piuttosto inefficiente, l'algoritmo di ottimizzazione simplex Nelder-Mead è molto efficace, così come i metodi di ottimizzazione della discesa del gradiente. La ricerca della griglia è semplice, ma un po '"forza bruta".
Dikran Marsupial,

@Vebjorn Ljosa (un anno dopo), quanto si spargono i 5 valori, diciamo in finale (C, gamma)? I 12 grafici sono tutti ridimensionati allo stesso modo, ad es. 50% .. 100% di previsione corretta? Grazie
denis l'

Risposte:


9

I valori ottimali per gli iperparametri saranno diversi per i diversi tak di apprendimento, è necessario regolarli separatamente per ogni problema.

Il motivo per cui non si ottiene un singolo ottimale è perché sia ​​il parametro del kernel che il parametro di regolarizzazione controllano la complessità del modello. Se C è piccolo ottieni un modello uniforme, allo stesso modo se il kernel con è ampio, otterrai un modello uniforme (poiché le funzioni di base non sono molto locali). Ciò significa che diverse combinazioni di C e la larghezza del kernel portano a modelli altrettanto complessi, con prestazioni simili (motivo per cui ottieni la funzione diagonale in molti dei grafici che hai).

L'ottimale dipende anche dal particolare campionamento del set di allenamento. È possibile sovrastimare l'errore di convalida incrociata, quindi la scelta degli iperparametri mediante convalida incrociata può effettivamente peggiorare le prestazioni se si è sfortunati. Vedi Cawley e Talbot per qualche discussione su questo.

Il fatto che esista un ampio plateau di valori per gli iperparametri in cui si ottengono valori altrettanto buoni è in realtà una buona caratteristica delle macchine vettoriali di supporto in quanto suggerisce che non sono eccessivamente vulnerabili al sovradimensionamento nella selezione del modello. Se avessi un picco acuto ai valori ottimali, sarebbe una brutta cosa poiché il picco sarebbe difficile da trovare usando un set di dati finito che fornirebbe un'indicazione inaffidabile di dove risieda effettivamente quel picco.


A proposito, sto eseguendo uno studio sull'adattamento eccessivo nella selezione del modello usando la ricerca della griglia, che risulta essere molto più interessante di quanto pensassi. Anche con pochi iperparametri, puoi comunque sovrapporre il criterio di selezione del modello se ottimizzi su una griglia che è troppo fine!
Dikran Marsupial,

Mi sto avvicinando alla fine del lavoro di simulazione, spero di poter presentare il documento tra un mese o due ...
Dikran Marsupial,

Sarei interessato a leggere quel documento se è finito? Mi sono imbattuto in alcuni strani picchi ecc. Nelle ottimizzazioni della ricerca della griglia che sembrano simili a ciò di cui discutete qui.
BGreene,

Tutto il lavoro di simulazione è ora completo, al momento sto solo mettendo insieme il foglio (soprattutto per assicurarmi che sia completamente riproducibile). Ho salvato tutte le griglie, quindi un po 'di rianalisi dovrebbe essere possibile esaminare altre domande a cui non avevo pensato in quel momento.
Dikran Marsupial,
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.