Transformă un Spark DataFrame în pandas
Să presupunem că ai rulat o interogare pe un set de date foarte mare și ai agregat rezultatele până la ceva mai ușor de gestionat.
Uneori are sens să iei acel tabel și să lucrezi cu el local, folosind un instrument precum pandas. Spark DataFrames simplifică această operație prin metoda .toPandas(). Apelând această metodă pe un Spark DataFrame, obții DataFrame-ul pandas corespunzător. Atât de simplu!
De această dată, interogarea numără zborurile către fiecare aeroport din SEA și PDX.
Reține că în spațiul tău de lucru există deja o SparkSession numită spark!
Acest exercițiu face parte din cursul
Fundamente PySpark
Instrucțiuni pentru exercițiu
- Rulează interogarea folosind metoda
.sql(). Salvează rezultatul înflight_counts. - Folosește metoda
.toPandas()peflight_countspentru a crea unDataFramepandasnumitpd_counts. - Afișează
.head()al luipd_countsîn consolă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)