Ho un grande datafame (circa 12 M righe) df con dire:
df.columns = ['word','documents','frequency']
Quindi quanto segue ha funzionato in modo tempestivo:
word_grouping = df[['word','frequency']].groupby('word')
MaxFrequency_perWord = word_grouping[['frequency']].max().reset_index()
MaxFrequency_perWord.columns = ['word','MaxFrequency']
Tuttavia, ciò richiede un tempo imprevisto per l'esecuzione:
Occurrences_of_Words = word_grouping[['word']].count().reset_index()
Cosa sto facendo di sbagliato qui? Esiste un modo migliore per contare le ricorrenze in un frame di dati di grandi dimensioni?
df.word.describe()
ha funzionato abbastanza bene, quindi non mi aspettavo davvero che questo frame di dati Occurrences_of_Words richiedesse molto tempo per essere costruito.
ps: se la risposta è ovvia e senti il bisogno di penalizzarmi per aver posto questa domanda, includi anche la risposta. grazie.
df.word.value_counts()['myword']è circa due volte più veloce dilen(df[df.word == 'myword']).