Kom igångKom igång gratis

Omvandla en Spark DataFrame till pandas

Anta att du har kört en fråga mot ett stort dataset och aggregerat resultatet till något mer hanterbart.

Ibland är det praktiskt att ta den tabellen och arbeta med den lokalt med ett verktyg som pandas. Spark DataFrames gör det enkelt med metoden .toPandas(). När du anropar den här metoden på en Spark DataFrame returneras motsvarande pandas DataFrame – enkelt som det!

I den här uppgiften räknar frågan antalet flyg till varje flygplats från SEA och PDX.

Kom ihåg att det redan finns en SparkSession kallad spark i din arbetsmiljö!

Den här övningen är en del av kursen

Grunderna i PySpark

Visa kurs

Övningsinstruktioner

  • Kör frågan med metoden .sql(). Spara resultatet i flight_counts.
  • Använd metoden .toPandas()flight_counts för att skapa en pandas DataFrame kallad pd_counts.
  • Skriv ut .head() för pd_counts i konsolen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
Redigera och kör kod