Scienza dei dati

Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo

2
Tariffe aeree - Quale analisi dovrebbe essere utilizzata per rilevare il comportamento competitivo e la correlazione dei prezzi?
Voglio indagare sul comportamento di determinazione dei prezzi delle compagnie aeree, in particolare su come le compagnie aeree reagiscono ai prezzi dei concorrenti. Come direi che la mia conoscenza di analisi più complesse è piuttosto limitata, ho fatto principalmente tutti i metodi di base per raccogliere una visione generale dei …

1
Hashing Trick - cosa succede realmente
Quando gli algoritmi ML, ad esempio Vowpal Wabbit o alcune delle macchine di fattorizzazione che vincono le competizioni di click through rate ( Kaggle ), menzionano che le funzionalità sono "hash", cosa significa in realtà per il modello? Diciamo che esiste una variabile che rappresenta l'ID di un'aggiunta di Internet, …

2
Dati sul sentiment per Emoji
Per la sperimentazione, vorremmo usare l' emoji incorporato in molti tweet come dati di verità / allenamento di base per una semplice analisi quantitativa del senitment. I tweet di solito sono troppo destrutturati per far funzionare bene la PNL. Ad ogni modo, ci sono 722 Emoji in Unicode 6.0 e …






2
Algoritmo di corrispondenza delle preferenze
C'è questo progetto laterale a cui sto lavorando dove devo strutturare una soluzione al seguente problema. Ho due gruppi di persone (clienti). Il gruppo Aintende acquistare e il gruppo Bintende vendere un determinato prodotto X. Il prodotto ha una serie di attributi x_ie il mio obiettivo è facilitare la transazione …

3
Amazon RedShift sostituisce Hadoop per ~ 1XTB di dati?
C'è molto clamore intorno a Hadoop e al suo ecosistema. Tuttavia, in pratica, dove molti set di dati si trovano nell'intervallo di terabyte, non è più ragionevole utilizzare Amazon RedShift per eseguire query su set di dati di grandi dimensioni, piuttosto che impiegare tempo e fatica a costruire un cluster …

2
Svantaggi tra Storm e Hadoop (MapReduce)
Qualcuno può gentilmente parlarmi dei compromessi coinvolti nella scelta tra Storm e MapReduce in Hadoop Cluster per l'elaborazione dei dati? Naturalmente, a parte quello ovvio, Hadoop (elaborazione tramite MapReduce in un cluster Hadoop) è un sistema di elaborazione batch e Storm è un sistema di elaborazione in tempo reale. Ho …


3
Istanze vs. core quando si utilizza EC2
Lavorando su quelli che spesso si potrebbero definire progetti di "dati medi", sono stato in grado di parallelizzare il mio codice (principalmente per la modellazione e la previsione in Python) su un singolo sistema attraverso un numero di core compreso tra 4 e 32. Ora sto cercando di passare ai …
12 parallel  clusters  aws 

2
Una rete neurale può calcolare ?
In spirito del famoso scherzo di Tensorflow Fizz Buzz e del problema XOr ho iniziato a pensare, se è possibile progettare una rete neurale che implementa la funzione ?y=x2y=x2y = x^2 Data una rappresentazione di un numero (ad esempio come un vettore in forma binaria, in modo tale che il …


Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.