Zacznij terazZacznij za darmo

SQL i Parquet

Pliki Parquet świetnie sprawdzają się jako magazyn danych dla zapytań SQL w Sparku. Choć te same zapytania można wykonywać bezpośrednio za pomocą funkcji Pythona w Sparku, czasem wygodniej jest korzystać z zapytań SQL obok opcji pythonowych.

W tym ćwiczeniu wczytasz plik Parquet utworzony w poprzednim kroku i zarejestrujesz go jako tabelę SQL. Po rejestracji uruchomisz proste zapytanie względem tej tabeli (czyli pliku Parquet).

Obiekt spark oraz plik AA_DFW_ALL.parquet są już dla ciebie dostępne.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wczytaj plik AA_DFW_ALL.parquet do zmiennej flights_df.
  • Użyj metody createOrReplaceTempView, aby nadać alias tabeli flights.
  • Uruchom zapytanie Spark SQL względem tabeli flights.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
Edytuj i uruchom kod