Supponiamo di riuscire a osservare "corrispondenze" tra acquirenti e venditori in un mercato. Puoi anche osservare le caratteristiche sia degli acquirenti che dei venditori che desideri utilizzare per prevedere le partite future e formulare raccomandazioni per entrambe le parti del mercato.
Per semplicità, supponiamo che ci siano N acquirenti e N venditori e che ognuno trovi una corrispondenza. Vi sono N partite e (N-1) (N-1) non partite. Il set di dati di training all-inclusive ha osservazioni N + (N-1) * (N-1), che possono essere proibitive in termini di dimensioni. Sembrerebbe che il campionamento casuale delle non corrispondenze (N-1) (N-1) e l'addestramento di un algoritmo su dati ridotti potrebbe essere più efficiente. Le mie domande sono:
(1) Il campionamento dalle non partite per costruire un set di dati di allenamento è un modo ragionevole per affrontare questo problema?
(2) Se (1) è vero, esiste un modo rigoroso per decidere quanto grande di un pezzo di (N-1) (N-1) includere?