SQL och Parquet
Parquet-filer passar utmärkt som underliggande datalager för SQL-frågor i Spark. Även om det går att köra samma frågor direkt via Sparks Python-funktioner, är det ibland enklare att använda SQL parallellt med Python-alternativen.
I den här övningen läser vi in Parquet-filen som skapades i föregående övning och registrerar den som en SQL-tabell. När den är registrerad kör vi en enkel fråga mot tabellen (det vill säga Parquet-filen).
Objektet spark och filen AA_DFW_ALL.parquet finns tillgängliga automatiskt.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Importera filen
AA_DFW_ALL.parquettillflights_df. - Använd metoden
createOrReplaceTempViewför att ge tabellen aliasetflights. - Kör en Spark SQL-fråga mot tabellen
flights.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Read the Parquet file into flights_df
flights_df = spark.read.____(____)
# Register the temp table
flights_df.____('flights')
# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)