Nelle note di lezione della settimana 3 del corso di apprendimento automatico Coursera di Andrew Ng , viene aggiunto un termine alla funzione di costo per implementare la regolarizzazione:
Gli appunti delle lezioni dicono:
Potremmo anche regolarizzare tutti i nostri parametri theta in un'unica somma:
viene successivamente applicato al termine di regolarizzazione delle reti neurali :
Ricordiamo che la funzione di costo per la regressione logistica regolarizzata era:
Per le reti neurali, sarà leggermente più complicato:
- Perché la metà costante viene utilizzata qui? In modo che sia cancellato nella derivata ?
- Perché la divisione per esempi di formazione? In che modo la quantità di esempi di formazione influisce sulle cose?