ÎncepețiÎncepe gratuit

Salvarea unui DataFrame în format Parquet

Când lucrezi cu Spark, vei începe de obicei cu fișiere CSV, JSON sau alte surse de date. Acest lucru oferă multă flexibilitate în ceea ce privește tipurile de date pe care le poți încărca, însă nu este un format optim pentru Spark. Formatul Parquet este un tip de stocare coloniară a datelor, care îi permite lui Spark să folosească predicate pushdown. Astfel, Spark va procesa doar datele necesare pentru a finaliza operațiunile definite de tine, în loc să citească întregul set de date. Aceasta oferă lui Spark mai multă flexibilitate în accesarea datelor și îmbunătățește semnificativ performanța pe seturi de date mari.

În acest exercițiu, vei exersa crearea unui fișier Parquet nou și apoi vei procesa date din acesta.

Obiectul spark și DataFrame-urile df1 și df2 au fost deja configurate pentru tine.

Acest exercițiu face parte din cursul

Curățarea datelor cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Afișează numărul de rânduri din df1 și df2.
  • Combină df1 și df2 într-un DataFrame nou numit df3 folosind metoda union.
  • Salvează df3 într-un fișier parquet cu numele AA_DFW_ALL.parquet.
  • Citește fișierul AA_DFW_ALL.parquet și afișează numărul de rânduri.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())

# Combine the DataFrames into one
df3 = df1.union(df2)

# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')

# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())
Editează și rulează codul