ПочатиПочніть безкоштовно

Запис у файл

У відео ви бачили, що файли часто завантажують до MPP-бази даних, як-от Redshift, щоб зробити їх доступними для аналізу.

Типовий робочий процес такий: спочатку дані записують у колонарні файли. Потім ці файли завантажують до системи зберігання, звідки їх можна скопіювати в сховище даних. Для Amazon Redshift, наприклад, такою системою зберігання є S3.

Перший крок — зберегти файл у потрібному форматі. У цій вправі ви оберете формат файлу Apache Parquet.

У вашому робочому середовищі є DataFrame PySpark під назвою film_sdf і DataFrame pandas під назвою film_pdf.

Ця вправа є частиною курсу

Вступ до Data Engineering

Переглянути курс

Інструкції до вправи

  • Запишіть датафрейм pandas film_pdf у файл Parquet з назвою "films_pdf.parquet".
  • Запишіть датафрейм PySpark film_sdf у файл Parquet з назвою "films_sdf.parquet".

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
Редагувати та запускати код