Запись в файл
Из видео вы узнали, что данные часто загружают в MPP-базы данных, например Redshift, чтобы сделать их доступными для анализа.
Типичный рабочий процесс выглядит так: данные записываются в столбцовые файлы, затем эти файлы загружаются в систему хранения, откуда их можно скопировать в хранилище данных. Например, в случае Amazon Redshift такой системой хранения является S3.
Первый шаг — сохранить данные в нужном формате. В этом упражнении вы будете использовать формат файлов Apache Parquet.
В вашем рабочем пространстве доступны PySpark DataFrame film_sdf и pandas DataFrame film_pdf.
Это упражнение является частью курса
Введение в дата-инжиниринг
Инструкции к упражнению
- Запишите pandas DataFrame
film_pdfв файл parquet с именем"films_pdf.parquet". - Запишите PySpark DataFrame
film_sdfв файл parquet с именем"films_sdf.parquet".
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")