ПочатиПочніть безкоштовно

Збереження датафрейму у форматі Parquet

Працюючи зі Spark, ви часто починатимете з CSV, JSON або інших джерел даних. Це дає велику гнучкість у типах даних для завантаження, але не є оптимальним форматом для Spark. Формат Parquet — це колонарне сховище даних, яке дає змогу Spark застосовувати predicate pushdown. Тобто Spark обробляє лише ті дані, які потрібні для виконання визначених вами операцій, замість читання всього набору даних. Це надає Spark більше гнучкості в доступі до даних і часто суттєво підвищує продуктивність на великих наборах даних.

У цій вправі ви потренуєтеся створювати новий файл Parquet, а потім обробляти з нього дані.

Об'єкт spark і датафрейми df1 та df2 уже підготовлено для вас.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Перегляньте кількість рядків у df1 та df2.
  • Об'єднайте df1 і df2 у новий датафрейм df3 за допомогою методу union.
  • Збережіть df3 у файл parquet з назвою AA_DFW_ALL.parquet.
  • Прочитайте файл AA_DFW_ALL.parquet і виведіть кількість рядків.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())

# Combine the DataFrames into one
df3 = df1.union(df2)

# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')

# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())
Редагувати та запускати код