Bắt đầu ngayBắt đầu miễn phí

Ghi ra tệp

Trong video, bạn đã thấy rằng các tệp thường được nạp vào cơ sở dữ liệu MPP như Redshift để phục vụ phân tích.

Quy trình điển hình là ghi dữ liệu vào các tệp dữ liệu dạng cột. Sau đó, các tệp này được tải lên một hệ thống lưu trữ và từ đó có thể được sao chép vào kho dữ liệu. Với Amazon Redshift, hệ thống lưu trữ có thể là S3, chẳng hạn.

Bước đầu tiên là ghi tệp theo đúng định dạng. Trong bài này, bạn sẽ chọn định dạng tệp Apache Parquet.

Trong không gian làm việc của bạn có một DataFrame PySpark tên là film_sdf và một DataFrame pandas tên là film_pdf.

Bài tập này là một phần của khóa học

Introduction to Data Engineering

Xem khóa học

Hướng dẫn bài tập

  • Ghi DataFrame pandas film_pdf ra tệp parquet có tên "films_pdf.parquet".
  • Ghi DataFrame PySpark film_sdf ra tệp parquet có tên "films_sdf.parquet".

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
Chỉnh sửa và Chạy Mã