Збереження датафрейму у форматі Parquet
Працюючи зі Spark, ви часто починатимете з CSV, JSON або інших джерел даних. Це дає велику гнучкість у типах даних для завантаження, але не є оптимальним форматом для Spark. Формат Parquet — це колонарне сховище даних, яке дає змогу Spark застосовувати predicate pushdown. Тобто Spark обробляє лише ті дані, які потрібні для виконання визначених вами операцій, замість читання всього набору даних. Це надає Spark більше гнучкості в доступі до даних і часто суттєво підвищує продуктивність на великих наборах даних.
У цій вправі ви потренуєтеся створювати новий файл Parquet, а потім обробляти з нього дані.
Об'єкт spark і датафрейми df1 та df2 уже підготовлено для вас.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Перегляньте кількість рядків у
df1таdf2. - Об'єднайте
df1іdf2у новий датафреймdf3за допомогою методуunion. - Збережіть
df3у файлparquetз назвоюAA_DFW_ALL.parquet. - Прочитайте файл
AA_DFW_ALL.parquetі виведіть кількість рядків.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# View the row count of df1 and df2
print("df1 Count: %d" % df1.____())
print("df2 Count: %d" % ____.____())
# Combine the DataFrames into one
df3 = df1.union(df2)
# Save the df3 DataFrame in Parquet format
df3.____.____('AA_DFW_ALL.parquet', mode='overwrite')
# Read the Parquet file into a new DataFrame and run a count
print(spark.read.____('AA_DFW_ALL.parquet').count())