Domande taggate «pandas»

Pandas è una libreria Python per la manipolazione e l'analisi dei dati, ad esempio frame di dati, serie temporali multidimensionali e set di dati trasversali che si trovano comunemente in statistica, risultati scientifici sperimentali, econometria o finanza. Pandas è una delle principali librerie di data science di Python.


3
Come convertire i frame di dati Panda in dizionario gerarchico
Ho il seguente frame di dati panda: df1 = pd.DataFrame({'date': [200101,200101,200101,200101,200102,200102,200102,200102],'blockcount': [1,1,2,2,1,1,2,2],'reactiontime': [350,400,200,250,100,300,450,400]}) Sto cercando di creare un dizionario gerarchico, con i valori del dizionario incorporato come elenchi, che assomigli a questo: {200101: {1:[350, 400], 2:[200, 250]}, 200102: {1:[100, 300], 2:[450, 400]}} Come lo farei? Il più vicino che ottengo …
16 python  pandas 

4
Confronto di elenchi in due colonne in ordine di riga
Quando si dispone di un Pandas DataFrame in questo modo: import pandas as pd import numpy as np df = pd.DataFrame({'today': [['a', 'b', 'c'], ['a', 'b'], ['b']], 'yesterday': [['a', 'b'], ['a'], ['a']]}) today yesterday 0 ['a', 'b', 'c'] ['a', 'b'] 1 ['a', 'b'] ['a'] 2 ['b'] ['a'] ... etc Ma …


6
Trova rapidamente coppie simmetriche in numpy
from itertools import product import pandas as pd df = pd.DataFrame.from_records(product(range(10), range(10))) df = df.sample(90) df.columns = "c1 c2".split() df = df.sort_values(df.columns.tolist()).reset_index(drop=True) # c1 c2 # 0 0 0 # 1 0 1 # 2 0 2 # 3 0 3 # 4 0 4 # .. .. .. # …
15 python  pandas  numpy 

3
Ottieni la distanza più vicina con due geodataframe in panda
Ecco il mio primo geodatframe: !pip install geopandas import pandas as pd import geopandas city1 = [{'City':"Buenos Aires","Country":"Argentina","Latitude":-34.58,"Longitude":-58.66}, {'City':"Brasilia","Country":"Brazil","Latitude":-15.78 ,"Longitude":-70.66}, {'City':"Santiago","Country":"Chile ","Latitude":-33.45 ,"Longitude":-70.66 }] city2 = [{'City':"Bogota","Country":"Colombia ","Latitude":4.60 ,"Longitude":-74.08}, {'City':"Caracas","Country":"Venezuela","Latitude":10.48 ,"Longitude":-66.86}] city1df = pd.DataFrame(city1) city2df = pd.DataFrame(city2) gcity1df = geopandas.GeoDataFrame( city1df, geometry=geopandas.points_from_xy(city1df.Longitude, city1df.Latitude)) gcity2df = geopandas.GeoDataFrame( city2df, geometry=geopandas.points_from_xy(city2df.Longitude, city2df.Latitude)) City1 …


2
Inferire quali colonne sono datetime
Ho un enorme frame di dati con molte colonne, molte delle quali sono di tipo datetime.datetime. Il problema è che molti hanno anche tipi misti, inclusi ad esempio datetime.datetimevalori e Nonevalori (e potenzialmente altri valori non validi): 0 2017-07-06 00:00:00 1 2018-02-27 21:30:05 2 2017-04-12 00:00:00 3 2017-05-21 22:05:00 4 …
14 python  pandas 


1
La funzione to_excel di panda genera un TypeError imprevisto
Ho creato un dizionario di dataframe panda: d[k] = pd.DataFrame(data=data[i]) Quindi presumo che d[k]sia un frame di dati panda corretto. Poi for k in d.keys(): d[k].to_excel (file_name) Quindi ho l'errore: TypeError: got invalid input value of type <class 'xml.etree.ElementTree.Element'>, expected string or Element Sto usando Python 3.7, Panda 0.25.3. Aggiornamento …

3
Panda lenti DataFrame MultiIndex reindex
Ho un panda DataFrame del modulo: id start_time sequence_no value 0 71 2018-10-17 20:12:43+00:00 114428 3 1 71 2018-10-17 20:12:43+00:00 114429 3 2 71 2018-10-17 20:12:43+00:00 114431 79 3 71 2019-11-06 00:51:14+00:00 216009 100 4 71 2019-11-06 00:51:14+00:00 216011 150 5 71 2019-11-06 00:51:14+00:00 216013 180 6 92 2019-12-01 00:51:14+00:00 …

2
Genera prodotti cartesiani binari filtrati
Dichiarazione problema Sto cercando un modo efficiente per generare prodotti cartesiani binari completi (tabelle con tutte le combinazioni di True e False con un certo numero di colonne), filtrate da determinate condizioni esclusive. Ad esempio, per tre colonne / bit n=3otterremmo la tabella completa df_combs = pd.DataFrame(itertools.product(*([[True, False]] * n))) …

1
pandasUDF e pyarrow 0.15.0
Di recente ho iniziato a ricevere un sacco di errori su una serie di pysparklavori in esecuzione su cluster EMR. Gli errori sono java.lang.IllegalArgumentException at java.nio.ByteBuffer.allocate(ByteBuffer.java:334) at org.apache.arrow.vector.ipc.message.MessageSerializer.readMessage(MessageSerializer.java:543) at org.apache.arrow.vector.ipc.message.MessageChannelReader.readNext(MessageChannelReader.java:58) at org.apache.arrow.vector.ipc.ArrowStreamReader.readSchema(ArrowStreamReader.java:132) at org.apache.arrow.vector.ipc.ArrowReader.initialize(ArrowReader.java:181) at org.apache.arrow.vector.ipc.ArrowReader.ensureInitialized(ArrowReader.java:172) at org.apache.arrow.vector.ipc.ArrowReader.getVectorSchemaRoot(ArrowReader.java:65) at org.apache.spark.sql.execution.python.ArrowPythonRunner$$anon$1.read(ArrowPythonRunner.scala:162) at org.apache.spark.sql.execution.python.ArrowPythonRunner$$anon$1.read(ArrowPythonRunner.scala:122) at org.apache.spark.api.python.BasePythonRunner$ReaderIterator.hasNext(PythonRunner.scala:406) at org.apache.spark.InterruptibleIterator.hasNext(InterruptibleIterator.scala:37) at org.apache.spark.sql.execution.python.ArrowEvalPythonExec$$anon$2.<init>(ArrowEvalPythonExec.scala:98) at org.apache.spark.sql.execution.python.ArrowEvalPythonExec.evaluate(ArrowEvalPythonExec.scala:96) …


9
crea una matrice NxN da un panda di colonna
ho un frame di dati con ogni riga con un valore di elenco. id list_of_value 0 ['a','b','c'] 1 ['d','b','c'] 2 ['a','b','c'] 3 ['a','b','c'] devo fare un calcolo di un punteggio con una riga e contro tutte le altre righe Ad esempio: Step 1: Take value of id 0: ['a','b','c'], Step …
11 python  pandas  numpy 

Utilizzando il nostro sito, riconosci di aver letto e compreso le nostre Informativa sui cookie e Informativa sulla privacy.
Licensed under cc by-sa 3.0 with attribution required.