Kom igångKom igång gratis

SQL och Parquet

Parquet-filer passar utmärkt som underliggande datalager för SQL-frågor i Spark. Även om det går att köra samma frågor direkt via Sparks Python-funktioner, är det ibland enklare att använda SQL parallellt med Python-alternativen.

I den här övningen läser vi in Parquet-filen som skapades i föregående övning och registrerar den som en SQL-tabell. När den är registrerad kör vi en enkel fråga mot tabellen (det vill säga Parquet-filen).

Objektet spark och filen AA_DFW_ALL.parquet finns tillgängliga automatiskt.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Importera filen AA_DFW_ALL.parquet till flights_df.
  • Använd metoden createOrReplaceTempView för att ge tabellen aliaset flights.
  • Kör en Spark SQL-fråga mot tabellen flights.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
Redigera och kör kod