Domande taggate «pandas»

Pandas è una libreria Python per la manipolazione e l'analisi dei dati, ad esempio frame di dati, serie temporali multidimensionali e set di dati trasversali che si trovano comunemente in statistica, risultati scientifici sperimentali, econometria o finanza. Pandas è una delle principali librerie di data science di Python.

1
Applica la funzione a ogni cella in DataFrame
Ho un dataframe che potrebbe assomigliare a questo: A B C foo bar foo bar bar foo foo bar Voglio esaminare ogni elemento di ogni riga (o ogni elemento di ogni colonna) e applicare la seguente funzione per ottenere il DF successivo: def foo_bar(x): return x.replace('foo', 'wow') A B C …


3
estraendo giorni da un valore numpy.timedelta64
Sto usando panda / python e ho due serie temporali di data s1 e s2, che sono state generate utilizzando la funzione 'to_datetime' su un campo del df contenente date / ore. Quando sottraggo s1 da s2 s3 = s2 - s1 Ottengo una serie, s3, di tipo timedelta64 [ns] …
87 python  numpy  pandas 

8
Panda: media rotolante per intervallo di tempo
Sono nuovo su Panda ... ho un sacco di dati sui sondaggi; Voglio calcolare una media mobile per ottenere una stima per ogni giorno basata su una finestra di tre giorni. Come ho capito da questa domanda , le funzioni rolling_ * calcolano la finestra in base a un numero …

2
Come impostare xlim e ylim in Seaborn lmplot facetgrid
Sto usando lmplot di Seaborn per tracciare una regressione lineare, dividendo il mio set di dati in due gruppi con una variabile categoriale. Sia per x che per y, vorrei impostare manualmente il limite inferiore su entrambi i grafici, ma lasciare il limite superiore al valore predefinito di Seaborn. Ecco …
87 python  pandas  seaborn 

13
ValueError: numpy.dtype ha la dimensione sbagliata, prova a ricompilarlo
Ho appena installato i pacchetti panda e statsmodels sul mio python 2.7. Quando ho provato a "importare panda come pd", viene visualizzato questo messaggio di errore. Qualcuno può aiutare? Grazie!!! numpy.dtype has the wrong size, try recompiling Traceback (most recent call last): File "<stdin>", line 1, in <module> File "C:\analytics\ext\python27\lib\site-packages\statsmodels-0.5.0-py2.7-win32.egg\statsmodels\formula\__init__.py", …

8
Dividi un grande dataframe panda
Ho un grande dataframe con 423244 linee. Voglio dividerlo in 4. Ho provato il seguente codice che ha dato un errore?ValueError: array split does not result in an equal division for item in np.split(df, 4): print item Come dividere questo dataframe in 4 gruppi?
86 python  pandas 

6
panda: filtro complesso sulle righe di DataFrame
Vorrei filtrare le righe in base a una funzione di ciascuna riga, ad es def f(row): return sin(row['velocity'])/np.prod(['masses']) > 5 df = pandas.DataFrame(...) filtered = df[apply_to_all_rows(df, f)] O per un altro esempio più complesso e artificioso, def g(row): if row['col1'].method1() == 1: val = row['col1'].method2() / row['col1'].method3(row['col3'], row['col4']) else: val …
86 python  pandas 


3
Calcola la differenza di tempo DataFrame di Pandas tra due colonne in ore e minuti
Ho due colonne fromdatee todate, in un dataframe. import pandas as pd data = {'todate': [pd.Timestamp('2014-01-24 13:03:12.050000'), pd.Timestamp('2014-01-27 11:57:18.240000'), pd.Timestamp('2014-01-23 10:07:47.660000')], 'fromdate': [pd.Timestamp('2014-01-26 23:41:21.870000'), pd.Timestamp('2014-01-27 15:38:22.540000'), pd.Timestamp('2014-01-23 18:50:41.420000')]} df = pd.DataFrame(data) Aggiungo una nuova colonna,, diffper trovare la differenza tra le due date utilizzando df['diff'] = df['fromdate'] - df['todate'] Ottengo …


3
Strano bug in Panda e Numpy per quanto riguarda il multithreading
La maggior parte della funzione di Numpy abiliterà il multithreading per impostazione predefinita. ad esempio, lavoro su una stazione di lavoro Intel a 8 core, se eseguo uno script import numpy as np x=np.random.random(1000000) for i in range(100000): np.sqrt(x) Linux topmostrerà un utilizzo della CPU dell'800% durante l'esecuzione come il …
25 python  pandas  numpy 


7
Controlla se la colonna Panda contiene tutti gli elementi di un elenco
Ho un df come questo: frame = pd.DataFrame({'a' : ['a,b,c', 'a,c,f', 'b,d,f','a,z,c']}) E un elenco di elementi: letters = ['a','c'] Il mio obiettivo è quello di ottenere tutte le righe frameche contengono almeno i 2 elementi inletters Ho trovato questa soluzione: for i in letters: subframe = frame[frame['a'].str.contains(i)] Questo mi …
20 python  pandas 


Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.