ÎncepețiÎncepe gratuit

Transformă un Spark DataFrame în pandas

Să presupunem că ai rulat o interogare pe un set de date foarte mare și ai agregat rezultatele până la ceva mai ușor de gestionat.

Uneori are sens să iei acel tabel și să lucrezi cu el local, folosind un instrument precum pandas. Spark DataFrames simplifică această operație prin metoda .toPandas(). Apelând această metodă pe un Spark DataFrame, obții DataFrame-ul pandas corespunzător. Atât de simplu!

De această dată, interogarea numără zborurile către fiecare aeroport din SEA și PDX.

Reține că în spațiul tău de lucru există deja o SparkSession numită spark!

Acest exercițiu face parte din cursul

Fundamente PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Rulează interogarea folosind metoda .sql(). Salvează rezultatul în flight_counts.
  • Folosește metoda .toPandas() pe flight_counts pentru a crea un DataFrame pandas numit pd_counts.
  • Afișează .head() al lui pd_counts în consolă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
Editează și rulează codul