НачатьНачать бесплатно

Запись в файл

Из видео вы узнали, что данные часто загружают в MPP-базы данных, например Redshift, чтобы сделать их доступными для анализа.

Типичный рабочий процесс выглядит так: данные записываются в столбцовые файлы, затем эти файлы загружаются в систему хранения, откуда их можно скопировать в хранилище данных. Например, в случае Amazon Redshift такой системой хранения является S3.

Первый шаг — сохранить данные в нужном формате. В этом упражнении вы будете использовать формат файлов Apache Parquet.

В вашем рабочем пространстве доступны PySpark DataFrame film_sdf и pandas DataFrame film_pdf.

Это упражнение является частью курса

Введение в дата-инжиниринг

Посмотреть курс

Инструкции к упражнению

  • Запишите pandas DataFrame film_pdf в файл parquet с именем "films_pdf.parquet".
  • Запишите PySpark DataFrame film_sdf в файл parquet с именем "films_sdf.parquet".

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
Редактировать и запускать код