寫入檔案
在影片中,你看到常會把檔案載入像 Redshift 這類的 MPP 資料庫,讓分析可以使用。
典型的流程是先把資料寫成欄式(columnar)的資料檔。這些檔案會上傳到儲存系統,之後再從那裡複製到資料倉儲。以 Amazon Redshift 為例,儲存系統通常是 S3。
第一步是把檔案寫成正確的格式。這題練習中,你會選用 Apache Parquet 檔案格式。
你的工作空間中有一個名為 film_sdf 的 PySpark DataFrame,以及一個名為 film_pdf 的 pandas DataFrame。
本練習屬於課程
Data Engineering 入門
練習說明
- 將
pandas的 DataFramefilm_pdf寫成名為"films_pdf.parquet"的 parquet 檔案。 - 將 PySpark 的 DataFrame
film_sdf寫成名為"films_sdf.parquet"的 parquet 檔案。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")