Domande taggate «clustering»

L'analisi del cluster è il compito di partizionare i dati in sottoinsiemi di oggetti in base alla reciproca "somiglianza", senza utilizzare conoscenze preesistenti come le etichette di classe. [Gli errori standard cluster e / o i campioni cluster dovrebbero essere contrassegnati come tali; NON usare il tag "clustering" per loro.]

4
Come testare un'implementazione di k-mean?
Disclaimer: ho pubblicato questa domanda su StackOverflow, ma ho pensato che forse fosse più adatto a questa piattaforma. Come testate la vostra implementazione k-mean per set di dati multidimensionali? Stavo pensando di eseguire un'implementazione già esistente (cioè Matlab) sui dati e confrontare i risultati con il mio algoritmo. Ma ciò …

2
Clustering molto distorto, contare i dati: qualche suggerimento da fare (trasformare, ecc.)?
Problema di base Ecco il mio problema di base: sto cercando di raggruppare un set di dati contenente alcune variabili molto distorte con conteggi. Le variabili contengono molti zeri e pertanto non sono molto istruttive per la mia procedura di clustering, che è probabilmente un algoritmo k-mean. Bene, dici, trasforma …


3
Quali sono i metodi statistici che posso usare per trovare combinazioni popolari o comuni di variabili categoriche?
Sto facendo uno studio sull'uso di polydrug. Ho un set di dati di 400 tossicodipendenti, che hanno dichiarato ciascuno i farmaci che abusano. Ci sono più di 10 farmaci e quindi grandi combinazioni possibili. Ho ricodificato la maggior parte delle droghe che consumano in variabili binarie (cioè l'eroina è 1 …

1
Comprensione dell'uso dei logaritmi nel logaritmo TF-IDF
Stavo leggendo: https://en.wikipedia.org/wiki/Tf%E2%80%93idf#Definition Ma non riesco a capire esattamente perché la formula sia stata costruita così com'è. Cosa capisco: a un certo livello l'iDF dovrebbe misurare la frequenza con cui appare un termine S in ciascuno dei documenti, diminuendo di valore man mano che il termine appare più frequentemente. Da …


1
Come devo interpretare le statistiche GAP?
Ho usato la statistica GAP per stimare i cluster k in R. Tuttavia non sono sicuro di interpretarla bene. Dalla trama sopra presumo che dovrei usare 3 cluster. Dalla seconda trama dovrei scegliere 6 cluster. È un'interpretazione corretta della statistica GAP? Sarei grato per qualsiasi spiegazione.
10 clustering 


2
PyMC per clustering non parametrico: il processo di Dirichlet per stimare i parametri della miscela gaussiana non riesce a raggrupparsi
Impostazione del problema Uno dei primi problemi con i giocattoli a cui volevo applicare PyMC è il clustering non parametrico: dati alcuni dati, modello come una miscela gaussiana e apprendimento del numero di cluster, media e covarianza di ciascun cluster. La maggior parte di ciò che so di questo metodo …

3
Come ottenere l'intervallo di confidenza sul cambio di r-square della popolazione
Per un semplice esempio, supponiamo che ci siano due modelli di regressione lineare Modello 1 ha tre predittori, x1a, x2b, ex2c Il modello 2 ha tre predittori dal modello 1 e due predittori aggiuntivi x2aex2b Esiste un'equazione di regressione della popolazione in cui la varianza della popolazione spiegata è per …



1
Perché Anova () e drop1 () hanno fornito risposte diverse per i GLMM?
Ho un GLMM del modulo: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) Quando uso drop1(model, test="Chi"), ottengo risultati diversi rispetto a quelli che utilizzo Anova(model, type="III")dal pacchetto auto o summary(model). Questi ultimi due danno le stesse risposte. Usando un mucchio di dati fabbricati, …
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 


1
Sulla correlazione copenica per il clustering di dendrogrammi
Considera il contesto di un cluster di dendrogrammi. Chiamiamo differenze originali tra le distanze degli individui. Dopo aver costruito il dendrogramma definiamo la dissomiglianza cophenetic tra due individui come la distanza tra i cluster a cui questi individui appartengono. Alcune persone ritengono che la correlazione tra le differenze originarie e …

Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.