Domande taggate «clustering»

L'analisi del cluster è il compito di partizionare i dati in sottoinsiemi di oggetti in base alla reciproca "somiglianza", senza utilizzare conoscenze preesistenti come le etichette di classe. [Gli errori standard cluster e / o i campioni cluster dovrebbero essere contrassegnati come tali; NON usare il tag "clustering" per loro.]




5
Come posso convertire la distanza (euclidea) in punteggio di somiglianza
Sto usando kkk significa raggruppare per raggruppare le voci dei relatori. Quando confronto un'enunciazione con i dati degli altoparlanti raggruppati ottengo una distorsione media (basata sulla distanza euclidea). Questa distanza può essere nell'intervallo di [0,∞][0,∞][0,\infty] . Voglio convertire questa distanza in un punteggio di somiglianza [0,1][0,1][0,1] . Per favore guidami …

1
Lo stato dell'arte nella deduplicazione
Quali sono i metodi all'avanguardia nella deduplicazione record? La deduplicazione viene talvolta chiamata: collegamento dei record, risoluzione dell'entità, risoluzione dell'identità, unione / eliminazione. Conosco ad esempio CBLOCK [1]. Gradirei se le risposte includessero anche riferimenti a software esistenti che implementano i metodi. So per esempio che Mahout implementa il raggruppamento …

1
Una routine per scegliere eps e minPts per DBSCAN
DBSCAN è l'algoritmo di clustering più citato secondo alcune pubblicazioni e può trovare cluster di forme arbitrari basati sulla densità. Ha due parametri eps (come raggio di vicinato) e minPts (come vicini minimi da considerare un punto come punto centrale) che credo dipenda fortemente da loro. Esiste un metodo di …


5
Tecniche di clustering appropriate per i dati temporali?
Ho dati temporali delle frequenze di attività. Voglio identificare i cluster nei dati che indicano periodi di tempo distinti con livelli di attività simili. Idealmente, voglio identificare i cluster senza specificare il numero di cluster a priori. Quali sono le tecniche di clustering appropriate? Se la mia domanda non contiene …


2
Utilizzo del test di significatività statistica per convalidare i risultati dell'analisi dei cluster
Sto esaminando l'uso del test di significatività statistica (SST) per convalidare i risultati dell'analisi dei cluster. Ho trovato diversi articoli su questo argomento, come ad esempio " Significato statistico del clustering per dati di dimensioni elevate, dimensioni ridotte del campione " di Liu, Yufeng et al. (2008) " Su alcuni …

2
Comprensione dei confronti dei risultati del clustering
Sto sperimentando la classificazione dei dati in gruppi. Sono abbastanza nuovo su questo argomento e sto cercando di capire l'output di alcune analisi. Utilizzando esempi tratti da Quick-R , Rvengono suggeriti diversi pacchetti. Ho provato a usare due di questi pacchetti ( fpcusando la kmeansfunzione e mclust). Un aspetto di …
13 r  clustering 

1
LARS vs discesa delle coordinate per il lazo
Quali sono i pro e i contro dell'utilizzo di LARS [1] rispetto all'utilizzo della discesa delle coordinate per l'adattamento della regressione lineare regolarizzata L1? Sono principalmente interessato agli aspetti prestazionali (i miei problemi tendono ad avere Ntra le centinaia di migliaia e p<20). Tuttavia, anche altre intuizioni sarebbero apprezzate. modifica: …




Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.