Salvarea unui DataFrame în format Parquet
Când lucrezi cu Spark, vei începe de obicei cu fișiere CSV, JSON sau alte surse de date. Acest lucru oferă multă flexibilitate în ceea ce privește tipurile de date pe care le poți încărca, însă nu este un format optim pentru Spark. Formatul Parquet este un tip de stocare coloniară a datelor, care îi permite lui Spark să folosească predicate pushdown. Astfel, Spark va procesa doar datele necesare pentru a finaliza operațiunile definite de tine, în loc să citească întregul set de date. Aceasta oferă lui Spark mai multă flexibilitate în accesarea datelor și îmbunătățește semnificativ performanța pe seturi de date mari.
În acest exercițiu, vei exersa crearea unui fișier Parquet nou și apoi vei procesa date din acesta.
Obiectul spark și DataFrame-urile df1 și df2 au fost deja configurate pentru tine.
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Instrucțiuni pentru exercițiu
- Afișează numărul de rânduri din
df1șidf2. - Combină
df1șidf2într-un DataFrame nou numitdf3folosind metodaunion. - Salvează
df3într-un fișierparquetcu numeleAA_DFW_ALL.parquet. - Citește fișierul
AA_DFW_ALL.parquetși afișează numărul de rânduri.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())
# Combine the DataFrames into one
df3 = df1.union(df2)
# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')
# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())