Запис у файл
У відео ви бачили, що файли часто завантажують до MPP-бази даних, як-от Redshift, щоб зробити їх доступними для аналізу.
Типовий робочий процес такий: спочатку дані записують у колонарні файли. Потім ці файли завантажують до системи зберігання, звідки їх можна скопіювати в сховище даних. Для Amazon Redshift, наприклад, такою системою зберігання є S3.
Перший крок — зберегти файл у потрібному форматі. У цій вправі ви оберете формат файлу Apache Parquet.
У вашому робочому середовищі є DataFrame PySpark під назвою film_sdf і DataFrame pandas під назвою film_pdf.
Ця вправа є частиною курсу
Вступ до Data Engineering
Інструкції до вправи
- Запишіть датафрейм
pandasfilm_pdfу файл Parquet з назвою"films_pdf.parquet". - Запишіть датафрейм PySpark
film_sdfу файл Parquet з назвою"films_sdf.parquet".
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")