SQL a Parquet
Soubory Parquet jsou ideálním datovým úložištěm pro SQL dotazy v Sparku. Přestože stejné dotazy lze spustit přímo přes Python funkce Sparku, někdy je pohodlnější kombinovat SQL dotazy s možnostmi Pythonu.
V tomto příkladu načteme soubor Parquet, který jsme vytvořili v předchozím cvičení, a zaregistrujeme ho jako SQL tabulku. Po registraci nad ní spustíme rychlý dotaz (tedy nad samotným souborem Parquet).
Objekt spark a soubor AA_DFW_ALL.parquet máš k dispozici automaticky.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Načti soubor
AA_DFW_ALL.parquetdo proměnnéflights_df. - Pomocí metody
createOrReplaceTempViewnastav alias tabulkyflights. - Spusť SQL dotaz v Sparku proti tabulce
flights.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Read the Parquet file into flights_df
flights_df = spark.read.____(____)
# Register the temp table
flights_df.____('flights')
# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)