Začněte nyníZačněte zdarma

SQL a Parquet

Soubory Parquet jsou ideálním datovým úložištěm pro SQL dotazy v Sparku. Přestože stejné dotazy lze spustit přímo přes Python funkce Sparku, někdy je pohodlnější kombinovat SQL dotazy s možnostmi Pythonu.

V tomto příkladu načteme soubor Parquet, který jsme vytvořili v předchozím cvičení, a zaregistrujeme ho jako SQL tabulku. Po registraci nad ní spustíme rychlý dotaz (tedy nad samotným souborem Parquet).

Objekt spark a soubor AA_DFW_ALL.parquet máš k dispozici automaticky.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Načti soubor AA_DFW_ALL.parquet do proměnné flights_df.
  • Pomocí metody createOrReplaceTempView nastav alias tabulky flights.
  • Spusť SQL dotaz v Sparku proti tabulce flights.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
Upravit a spustit kód