Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo
Per definizione, Relu è max(0,f(x)). Poi la sua pendenza è definito come: 1 if x > 0 and 0 if x < 0. Questo non significherebbe che il gradiente è sempre 0 (svanisce) quando x <0? Allora perché diciamo che Relu non soffre del problema svanire gradiente?
Principiante dell'analisi con Python, quindi per favore sii gentile :-) Non sono riuscito a trovare la risposta a questa domanda - mi scuso se ha già risposto altrove in un formato diverso. Ho un set di dati di dati di transazione per un punto vendita. Le variabili insieme alla spiegazione …
Ho un set di dati contenente dati su temperatura, precipitazioni e rese di soia per un'azienda agricola per 10 anni (2005-2014). Vorrei prevedere i rendimenti per il 2015 sulla base di questi dati. Si noti che il set di dati ha valori GIORNALIERI per temperatura e precipitazioni, ma solo 1 …
Dato il difficile compito di apprendimento (ad es. Alta dimensionalità, complessità intrinseca dei dati), le reti neurali profonde diventano difficili da addestrare. Per alleviare molti dei problemi si potrebbe: Normalizza && seleziona manualmente i dati di qualità scegliere un algoritmo di allenamento diverso (ad es. RMSprop invece di Discesa gradiente) …
È molto comune raccomandare che abbiamo dati sui prodotti degli utenti che hanno un'etichetta come ad esempio un "clic". Per apprendere il modello, ho bisogno di dati click e no-click. L'approccio più semplice da generare è quello di prendere coppie utente-prodotti che non si trovano nei dati sui clic. Tuttavia, …
Supponiamo di prevedere le vendite di un negozio e che i miei dati di formazione abbiano due serie di funzionalità: Uno sulle vendite del negozio con le date (il campo "Negozio" non è unico) Uno sui tipi di negozi (il campo "Store" è unico qui) Quindi la matrice sarebbe simile …
Capisco come un modello di Markov nascosto viene utilizzato nelle sequenze genomiche, come la ricerca di un gene. Ma non capisco come elaborare un modello Markov particolare. Voglio dire, quanti stati dovrebbe avere il modello? Quante possibili transizioni? Il modello dovrebbe avere un anello? Come fanno a sapere che il …
Vorrei confrontare la differenza tra la stessa parola menzionata in diverse fonti. Cioè, come gli autori differiscono nel loro uso di parole mal definite, come "democrazia". Era un breve piano Prendi i libri che menzionano il termine "democrazia" come testo semplice In ogni libro, sostituiscilo democracycondemocracy_%AuthorName% Allena un word2vecmodello su …
Sembra standard in molti pacchetti di reti neurali accoppiare la funzione obiettivo da minimizzare con la funzione di attivazione nel livello di output. Ad esempio, per uno strato di output lineare utilizzato per la regressione è standard (e spesso solo scelta) avere una funzione di obiettivo di errore al quadrato. …
Quindi, il nostro set di dati questa settimana ha 14 attributi e ogni colonna ha valori molto diversi. Una colonna ha valori inferiori a 1 mentre un'altra colonna ha valori che vanno da tre a quattro cifre intere. Abbiamo imparato la normalizzazione la scorsa settimana e sembra che dovresti normalizzare …
Chiuso . Questa domanda deve essere più focalizzata . Al momento non accetta risposte. Vuoi migliorare questa domanda? Aggiorna la domanda in modo che si concentri su un problema solo modificando questo post . Chiuso 3 anni fa . Il Web semantico è morto? Le ontologie sono morte? Sto sviluppando …
Sto cercando di costruire un hash sensibile alla località coseno in modo da poter trovare coppie di oggetti simili simili senza dover confrontare ogni possibile coppia. L'ho sostanzialmente funzionante, ma la maggior parte delle coppie nei miei dati sembra avere una somiglianza del coseno nell'intervallo da -0,2 a +0,2, quindi …
Sto cercando di formare una rete neurale artificiale con due strati convoluzionali (c1, c2) e due strati nascosti (c1, c2). Sto usando l'approccio standard di backpropagation. Nel passaggio indietro calcolo il termine di errore di un livello (delta) in base all'errore del livello precedente, ai pesi del livello precedente e …
supponiamo che io voglia addestrare un algoritmo stocastico di regressione della discesa del gradiente usando un set di dati che ha N campioni. Poiché la dimensione del set di dati è fissa, riutilizzerò i dati T volte. Ad ogni iterazione o "epoca", utilizzo ogni campione di allenamento esattamente una volta …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.