開始使用免費開始

寫入檔案

在影片中,你看到常會把檔案載入像 Redshift 這類的 MPP 資料庫,讓分析可以使用。

典型的流程是先把資料寫成欄式(columnar)的資料檔。這些檔案會上傳到儲存系統,之後再從那裡複製到資料倉儲。以 Amazon Redshift 為例,儲存系統通常是 S3。

第一步是把檔案寫成正確的格式。這題練習中,你會選用 Apache Parquet 檔案格式。

你的工作空間中有一個名為 film_sdf 的 PySpark DataFrame,以及一個名為 film_pdf 的 pandas DataFrame。

本練習屬於課程

Data Engineering 入門

檢視課程

練習說明

  • pandas 的 DataFrame film_pdf 寫成名為 "films_pdf.parquet" 的 parquet 檔案。
  • 將 PySpark 的 DataFrame film_sdf 寫成名為 "films_sdf.parquet" 的 parquet 檔案。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
編輯並執行程式碼