Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo
Voglio indagare sul comportamento di determinazione dei prezzi delle compagnie aeree, in particolare su come le compagnie aeree reagiscono ai prezzi dei concorrenti. Come direi che la mia conoscenza di analisi più complesse è piuttosto limitata, ho fatto principalmente tutti i metodi di base per raccogliere una visione generale dei …
Quando gli algoritmi ML, ad esempio Vowpal Wabbit o alcune delle macchine di fattorizzazione che vincono le competizioni di click through rate ( Kaggle ), menzionano che le funzionalità sono "hash", cosa significa in realtà per il modello? Diciamo che esiste una variabile che rappresenta l'ID di un'aggiunta di Internet, …
Per la sperimentazione, vorremmo usare l' emoji incorporato in molti tweet come dati di verità / allenamento di base per una semplice analisi quantitativa del senitment. I tweet di solito sono troppo destrutturati per far funzionare bene la PNL. Ad ogni modo, ci sono 722 Emoji in Unicode 6.0 e …
Classificherò documenti di testo non strutturati, vale a dire siti web di struttura sconosciuta. Il numero di classi a cui sto classificando è limitato (a questo punto, credo che non ce ne siano più di tre). Qualcuno ha un suggerimento su come potrei iniziare? L'approccio "bag of words" è possibile …
Attualmente sto lavorando con una vasta serie di dati sulle richieste di risarcimento che includono alcuni reclami di laboratorio e di farmacia. Le informazioni più coerenti nel set di dati, tuttavia, sono costituite da diagnosi (ICD-9CM) e codici di procedura (CPT, HCSPCS, ICD-9CM). I miei obiettivi sono: Identificare le condizioni …
Sto lavorando su un'applicazione che richiede la creazione di un database molto grande di n-grammi che esiste in un corpus di testo di grandi dimensioni. Ho bisogno di tre tipi di operazioni efficienti: ricerca e inserimento indicizzati dall'n-grammo stesso e interrogazione per tutti gli n-grammi che contengono un sotto-n-grammo. Mi …
Attualmente sto usando diversi classificatori diversi su varie entità estratte dal testo, e uso la precisione / richiamo come un riepilogo di come ciascun classificatore separato si comporta in un determinato set di dati. Mi chiedo se esiste un modo significativo per confrontare le prestazioni di questi classificatori in modo …
Comprendo che i metodi di compressione possono essere suddivisi in due set principali: globale Locale Il primo set funziona indipendentemente dai dati che vengono elaborati, ovvero non si basano su alcuna caratteristica dei dati e quindi non è necessario eseguire alcuna preelaborazione su qualsiasi parte del set di dati (prima …
C'è questo progetto laterale a cui sto lavorando dove devo strutturare una soluzione al seguente problema. Ho due gruppi di persone (clienti). Il gruppo Aintende acquistare e il gruppo Bintende vendere un determinato prodotto X. Il prodotto ha una serie di attributi x_ie il mio obiettivo è facilitare la transazione …
C'è molto clamore intorno a Hadoop e al suo ecosistema. Tuttavia, in pratica, dove molti set di dati si trovano nell'intervallo di terabyte, non è più ragionevole utilizzare Amazon RedShift per eseguire query su set di dati di grandi dimensioni, piuttosto che impiegare tempo e fatica a costruire un cluster …
Qualcuno può gentilmente parlarmi dei compromessi coinvolti nella scelta tra Storm e MapReduce in Hadoop Cluster per l'elaborazione dei dati? Naturalmente, a parte quello ovvio, Hadoop (elaborazione tramite MapReduce in un cluster Hadoop) è un sistema di elaborazione batch e Storm è un sistema di elaborazione in tempo reale. Ho …
Chiuso . Questa domanda è basata sull'opinione . Al momento non accetta risposte. Vuoi migliorare questa domanda? Aggiorna la domanda in modo che possa essere risolta con fatti e citazioni modificando questo post . Chiuso 5 anni fa . Essendo nuovo all'apprendimento automatico in generale, mi piacerebbe iniziare a giocare …
Lavorando su quelli che spesso si potrebbero definire progetti di "dati medi", sono stato in grado di parallelizzare il mio codice (principalmente per la modellazione e la previsione in Python) su un singolo sistema attraverso un numero di core compreso tra 4 e 32. Ora sto cercando di passare ai …
In spirito del famoso scherzo di Tensorflow Fizz Buzz e del problema XOr ho iniziato a pensare, se è possibile progettare una rete neurale che implementa la funzione ?y=x2y=x2y = x^2 Data una rappresentazione di un numero (ad esempio come un vettore in forma binaria, in modo tale che il …
So che un'architettura di rete neurale si basa principalmente sul problema stesso e sui tipi di input / output, ma comunque - ce n'è sempre uno "quadrato" quando si inizia a costruirne uno. Quindi la mia domanda è - dato un set di dati di input di MxN (M è …
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.