Che cos'è il "rifiuto dell'inferenza" e come può essere utilizzato per aumentare la precisione di un modello?


10

Qualcuno può spiegare in dettaglio:

  1. Cosa significa rifiutare l'inferenza?
  2. Come può essere utilizzato per aumentare la precisione del mio modello?

Ho idea di rifiutare di inferire nell'applicazione della carta di credito, ma alle prese con l'idea di usarlo per aumentare l'accuratezza del mio modello.

Risposte:


23

Nella costruzione del modello di credito, l'inferenza di rifiuto è il processo per inferire la performance dei conti di credito che sono stati rifiutati nel processo di domanda.

Quando si costruisce un modello di rischio di credito delle applicazioni, vogliamo costruire un modello che abbia l' applicabilità " attraverso la porta ", ovvero, inseriamo tutti i dati dell'applicazione nel modello di rischio di credito e il modello genera una valutazione del rischio o una probabilità di default. Il problema quando si utilizza la regressione per creare un modello dai dati passati è che conosciamo le prestazioni dell'account solo per le applicazioni accettate in passato. Tuttavia, non conosciamo le prestazioni degli scarti, perché dopo l'applicazione li abbiamo rimandati fuori dalla porta. Ciò può comportare distorsioni di selezione nel nostro modello, perché se nel nostro modello utilizziamo solo "accettazioni" passate, il modello potrebbe non funzionare bene sulla popolazione "through-the-door".

Esistono molti modi per gestire l'inferenza del rifiuto, tutti controversi. Ne citerò due semplici qui.

  • "Definisci gli scarti passati come negativi"
  • parcellizzazione

"Definisci gli scarti passati come errati" sta semplicemente prendendo tutti i dati dell'applicazione respinti e invece di scartarli durante la creazione del modello, assegnali tutti come non validi. Questo metodo orienta fortemente il modello verso la politica di accettazione / rifiuto passata.

"Parceling" è un po 'più sofisticato. Consiste in

  1. Costruisci il modello di regressione con il passato "accetta"
  2. Applicare il modello agli scarti precedenti per assegnare loro valutazioni del rischio
  3. Utilizzando la probabilità di default prevista per ciascun rating di rischio, assegnare le domande respinte a essere buone o cattive. Ad esempio, se la valutazione del rischio ha una probabilità di default del 10% e ci sono 100 domande respinte che rientrano in questa valutazione del rischio, assegnare 10 dei rifiuti a "cattivo" e 90 dei rifiuti a "buono".
  4. Ricostruire il modello di regressione utilizzando le applicazioni accettate e ora le prestazioni inferite delle applicazioni rifiutate

Esistono diversi modi per eseguire gli incarichi nel bene e nel male nel passaggio 3 e questo processo può anche essere applicato in modo iterativo.

Come affermato in precedenza, l'uso dell'inferenza di rifiuto è controverso ed è difficile dare una risposta semplice su come può essere utilizzato per aumentare la precisione dei modelli. Ne citerò semplicemente altri su questo argomento.

Jonathan Crook e John Banasik, Rifiutare l'inferenza migliora davvero le prestazioni dei modelli di punteggio dell'applicazione?

In primo luogo, anche se una gran parte dei richiedenti viene respinta, la possibilità di migliorare un modello parametrizzato solo su quelli accettati appare modesta. Laddove il tasso di rifiuto non è così elevato, tale ambito sembra essere davvero molto ridotto.

David Hand, "Inferenza diretta nelle operazioni di credito", che compare nel Manuale di Credit Scoring, 2001

Sono stati proposti e utilizzati diversi metodi e, sebbene alcuni di essi siano chiaramente scarsi e non dovrebbero mai essere raccomandati, non esiste un metodo unico e unico di applicabilità universale se non si ottengono ulteriori informazioni. Cioè, la soluzione migliore è ottenere maggiori informazioni (magari concedendo prestiti ad alcuni potenziali scarti) su quei candidati che rientrano nella regione di rifiuto.


1
+1 per un'ampia panoramica. Ora so anche cosa è l'inferenza di rifiuto :)
mpiktas,

1
Grazie. ma come si assegna al passaggio 3? Ho letto che per usare 1 o 0 puoi usare la probabilità per ogni riga. Quindi avrai la stessa persona con il 10% e il 90%. Come può funzionare con la creazione di un nuovo modello logistico?
GabyLP,

1

@GabyLP nei commenti precedenti. Sulla base della mia esperienza, è possibile dividere tali clienti in due parti e assegnare pesi per entrambe le divisioni in base alla probabilità. Ad esempio, se un client rifiutato ha un PD del 10%, è possibile ricavarne due da questo. In primo luogo con variabile target 1 e peso 0,1 e secondo con variabile target 0 e peso 0,9.

L'intero campione accettato di clienti avrà pesi == 1.

Sebbene funzioni con la regressione logistica, non funziona con i modelli basati su alberi.


Hai una fonte per la tua dichiarazione?
T. Beige,

Se la domanda è che non funziona su modelli basati su alberi, allora la mia risposta è: esperienza personale. Ho cercato di attuare questo approccio ma non ci sono riuscito.
MiksL
Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.