Uložení DataFrame ve formátu Parquet
Při práci se Sparkem začínáš nejčastěji s CSV, JSON nebo jinými datovými zdroji. To ti dává velkou flexibilitu při načítání různých typů dat, ale pro Spark to není optimální formát. Formát Parquet je sloupcové datové úložiště, které Sparku umožňuje využívat predicate pushdown. To znamená, že Spark zpracuje jen ta data, která jsou skutečně potřebná k dokončení definovaných operací – místo toho, aby četl celou datovou sadu. Spark tak získává větší flexibilitu při přístupu k datům a výkon na velkých datových sadách se často výrazně zlepší.
V tomto cvičení si procvičíš vytvoření nového souboru Parquet a zpracování dat z něj.
Objekt spark a DataFramy df1 a df2 jsou již připraveny.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Zobraz počet řádků v
df1adf2. - Spoj
df1adf2do nového DataFramedf3pomocí metodyunion. - Ulož
df3do souboruparquets názvemAA_DFW_ALL.parquet. - Načti soubor
AA_DFW_ALL.parqueta zobraz počet řádků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())
# Combine the DataFrames into one
df3 = df1.union(df2)
# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')
# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())