1. Learn
  2. /
  3. Courses
  4. /
  5. Очищення даних у PySpark

Connected

Exercise

Збереження датафрейму у форматі Parquet

Працюючи зі Spark, ви часто починатимете з CSV, JSON або інших джерел даних. Це дає велику гнучкість у типах даних для завантаження, але не є оптимальним форматом для Spark. Формат Parquet — це колонарне сховище даних, яке дає змогу Spark застосовувати predicate pushdown. Тобто Spark обробляє лише ті дані, які потрібні для виконання визначених вами операцій, замість читання всього набору даних. Це надає Spark більше гнучкості в доступі до даних і часто суттєво підвищує продуктивність на великих наборах даних.

У цій вправі ви потренуєтеся створювати новий файл Parquet, а потім обробляти з нього дані.

Об'єкт spark і датафрейми df1 та df2 уже підготовлено для вас.

Instructions

100 XP
  • Перегляньте кількість рядків у df1 та df2.
  • Об'єднайте df1 і df2 у новий датафрейм df3 за допомогою методу union.
  • Збережіть df3 у файл parquet з назвою AA_DFW_ALL.parquet.
  • Прочитайте файл AA_DFW_ALL.parquet і виведіть кількість рядків.