Převod Spark DataFrame na pandas
Představ si, že jsi spustil/a dotaz nad obrovským datasetem a agregoval/a ho na něco mnohem přehlednějšího.
V takových případech dává smysl vzít výslednou tabulku a pracovat s ní lokálně pomocí nástroje, jako je pandas. Spark DataFrames to usnadňují metodou .toPandas(). Zavoláním této metody na Spark DataFrame získáš odpovídající pandas DataFrame. Tak jednoduché to je!
Tento dotaz počítá, kolik letů míří z SEA a PDX na každé letiště.
Nezapomeň, že ve tvém pracovním prostředí je už připravená SparkSession s názvem spark!
Toto cvičení je součástí kurzu
Foundations of PySpark
Pokyny k cvičení
- Spusť dotaz pomocí metody
.sql(). Výsledek ulož do proměnnéflight_counts. - Použij metodu
.toPandas()naflight_countsa vytvořpandasDataFrame s názvempd_counts. - Vypiš do konzole výstup metody
.head()proměnnépd_counts.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)