Začněte nyníZačněte zdarma

Uložení DataFrame ve formátu Parquet

Při práci se Sparkem začínáš nejčastěji s CSV, JSON nebo jinými datovými zdroji. To ti dává velkou flexibilitu při načítání různých typů dat, ale pro Spark to není optimální formát. Formát Parquet je sloupcové datové úložiště, které Sparku umožňuje využívat predicate pushdown. To znamená, že Spark zpracuje jen ta data, která jsou skutečně potřebná k dokončení definovaných operací – místo toho, aby četl celou datovou sadu. Spark tak získává větší flexibilitu při přístupu k datům a výkon na velkých datových sadách se často výrazně zlepší.

V tomto cvičení si procvičíš vytvoření nového souboru Parquet a zpracování dat z něj.

Objekt spark a DataFramy df1 a df2 jsou již připraveny.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Zobraz počet řádků v df1 a df2.
  • Spoj df1 a df2 do nového DataFrame df3 pomocí metody union.
  • Ulož df3 do souboru parquet s názvem AA_DFW_ALL.parquet.
  • Načti soubor AA_DFW_ALL.parquet a zobraz počet řádků.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())

# Combine the DataFrames into one
df3 = df1.union(df2)

# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')

# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())
Upravit a spustit kód