Domande e risposte per i professionisti della scienza dei dati, gli specialisti di Machine Learning e coloro che sono interessati a saperne di più sul campo
Sto lavorando a un progetto e ho bisogno di risorse per mettermi al passo. Il set di dati contiene circa 35000 osservazioni su circa 30 variabili. Circa la metà delle variabili sono categoriche con alcune che hanno molti diversi valori possibili, vale a dire se si dividono le variabili categoriali …
In alcuni casi, potrebbe essere impossibile disegnare diagrammi di Eulero con cerchi sovrapposti per rappresentare tutti i sottoinsiemi sovrapposti nelle proporzioni corrette. Questo tipo di dati richiede quindi l'utilizzo di poligoni o altre figure per rappresentare ogni set. Quando si tratta di dati che descrivono sottoinsiemi sovrapposti, come posso capire …
Ho cercato di rilevare valori anomali nel consumo di gas energetico di alcuni edifici olandesi, costruendo un modello di rete neurale. Ho dei risultati molto negativi, ma non riesco a trovare il motivo. Non sono un esperto, quindi vorrei chiederti cosa posso migliorare e cosa sto facendo di sbagliato. Questa …
Come tutti sappiamo, esistono alcune tecniche di indicizzazione dei dati, che vengono utilizzate da app di indicizzazione ben note, come Lucene (per Java) o Lucene.NET (per .NET), MurMurHash, B + Tree ecc. Per un oggetto No-Sql / Database orientato (che cerco di scrivere / riprodurre un po 'con C #), …
Yann LeCun ha menzionato nel suo AMA che considera molto importante avere un dottorato di ricerca per ottenere un lavoro in una delle migliori aziende. Ho un master in statistica e il mio corso di laurea in economia e matematica applicata, ma ora sto esaminando i programmi di dottorato di …
Nel rivedere la " Modellazione predittiva applicata " un revisore afferma : Una critica che ho della pedagogia dell'apprendimento statistico (SL) è l'assenza di considerazioni sulle prestazioni di calcolo nella valutazione delle diverse tecniche di modellizzazione. Con la sua enfasi sul bootstrap e la validazione incrociata per mettere a punto …
Contesto: Di seguito è riportato il libro Graph D Database , che copre un test delle prestazioni menzionato nel libro Neo4j in azione : Le relazioni in un grafico formano naturalmente percorsi. Interrogazione o spostamento, il grafico prevede i seguenti percorsi. A causa della natura fondamentalmente orientata al percorso del …
Qualsiasi elaborazione di database di piccole dimensioni può essere facilmente gestita dagli script Python / Perl / ..., che utilizza librerie e / o persino utilità dal linguaggio stesso. Tuttavia, quando si tratta di prestazioni, le persone tendono a cercare linguaggi C / C ++ / di basso livello. La …
Ho imparato a conoscere le reti neurali convoluzionali. Guardando Kerasesempi, mi sono imbattuto in tre diversi metodi di convoluzione. Vale a dire, 1D, 2D e 3D. Quali sono le differenze tra questi tre strati? Quali sono i loro casi d'uso? Ci sono alcuni link o riferimenti per mostrare i loro …
Attualmente sto lavorando a un modello di regressione logistica per la genomica. Uno dei campi di input che voglio includere come covariata ègenes . Esistono circa 24.000 geni noti. Ci sono molte caratteristiche con questo livello di variabilità nella biologia computazionale e sono necessarie centinaia di migliaia di campioni. Se …
Sto studiando il ridimensionamento dei dati, in particolare il metodo di standardizzazione. Ho capito la matematica che sta dietro, ma non mi è chiaro perché sia importante assegnare alle caratteristiche zero media e varianza unitaria. Mi puoi spiegare ?
Vorrei controllare i file JPG se sono stati manipolati per modificare il contenuto. Quello che considero NON photoshopped: ritaglio rotante (Scaling) Risoluzione dell'immagine Le modifiche automatiche potrebbero essere apportate dagli smartphone Cosa considero photoshopping: Aggiunta di una nuova immagine sopra parti della vecchia immagine Modifica del testo di una parte …
Ho capito che l'analisi dei componenti principali è una tecnica di riduzione della dimensionalità, cioè dato 10 funzioni di input, produrrà un numero minore di funzioni indipendenti che sono trasformazione ortogonale e lineare di caratteristiche originali. È di PCAper sé considerato un algoritmo di apprendimento o è una fase di …
Ho set di dati che contengono, tra le molte funzioni, le coordinate GPS (latitudine e longitudine). Vorrei utilizzare questi set di dati per esplorare problemi quali: (1) il calcolo dell'ETA per guidare tra i punti iniziale e finale; e (2) stimare l'entità del crimine per un punto specifico. Vorrei usare …
Conducendo un modello di regressione lineare usando una funzione di perdita, perché dovrei usare invece della regolarizzazione ?L1L1L_1L2L2L_2 È meglio prevenire l'eccessivo adattamento? È deterministico (quindi sempre una soluzione unica)? È meglio nella selezione delle caratteristiche (perché produce modelli sparsi)? Dissipa i pesi tra le caratteristiche?
We use cookies and other tracking technologies to improve your browsing experience on our website,
to show you personalized content and targeted ads, to analyze our website traffic,
and to understand where our visitors are coming from.
By continuing, you consent to our use of cookies and other tracking technologies and
affirm you're at least 16 years old or have consent from a parent or guardian.