Omvandla en Spark DataFrame till pandas
Anta att du har kört en fråga mot ett stort dataset och aggregerat resultatet till något mer hanterbart.
Ibland är det praktiskt att ta den tabellen och arbeta med den lokalt med ett verktyg som pandas. Spark DataFrames gör det enkelt med metoden .toPandas(). När du anropar den här metoden på en Spark DataFrame returneras motsvarande pandas DataFrame – enkelt som det!
I den här uppgiften räknar frågan antalet flyg till varje flygplats från SEA och PDX.
Kom ihåg att det redan finns en SparkSession kallad spark i din arbetsmiljö!
Den här övningen är en del av kursen
Grunderna i PySpark
Övningsinstruktioner
- Kör frågan med metoden
.sql(). Spara resultatet iflight_counts. - Använd metoden
.toPandas()påflight_countsför att skapa enpandasDataFrame kalladpd_counts. - Skriv ut
.head()förpd_countsi konsolen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)