SQL i Parquet
Pliki Parquet świetnie sprawdzają się jako magazyn danych dla zapytań SQL w Sparku. Choć te same zapytania można wykonywać bezpośrednio za pomocą funkcji Pythona w Sparku, czasem wygodniej jest korzystać z zapytań SQL obok opcji pythonowych.
W tym ćwiczeniu wczytasz plik Parquet utworzony w poprzednim kroku i zarejestrujesz go jako tabelę SQL. Po rejestracji uruchomisz proste zapytanie względem tej tabeli (czyli pliku Parquet).
Obiekt spark oraz plik AA_DFW_ALL.parquet są już dla ciebie dostępne.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Wczytaj plik
AA_DFW_ALL.parquetdo zmiennejflights_df. - Użyj metody
createOrReplaceTempView, aby nadać alias tabeliflights. - Uruchom zapytanie Spark SQL względem tabeli
flights.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Read the Parquet file into flights_df
flights_df = spark.read.____(____)
# Register the temp table
flights_df.____('flights')
# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)