Ghi ra tệp
Trong video, bạn đã thấy rằng các tệp thường được nạp vào cơ sở dữ liệu MPP như Redshift để phục vụ phân tích.
Quy trình điển hình là ghi dữ liệu vào các tệp dữ liệu dạng cột. Sau đó, các tệp này được tải lên một hệ thống lưu trữ và từ đó có thể được sao chép vào kho dữ liệu. Với Amazon Redshift, hệ thống lưu trữ có thể là S3, chẳng hạn.
Bước đầu tiên là ghi tệp theo đúng định dạng. Trong bài này, bạn sẽ chọn định dạng tệp Apache Parquet.
Trong không gian làm việc của bạn có một DataFrame PySpark tên là film_sdf và một DataFrame pandas tên là film_pdf.
Bài tập này là một phần của khóa học
Introduction to Data Engineering
Hướng dẫn bài tập
- Ghi DataFrame
pandasfilm_pdfra tệp parquet có tên"films_pdf.parquet". - Ghi DataFrame PySpark
film_sdfra tệp parquet có tên"films_sdf.parquet".
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")