ファイルへの書き出し
動画では、分析で使えるようにするため、ファイルが Redshift のような MPP データベースにロードされることが多いと説明しました。
一般的なワークフローでは、まずデータをカラムナ形式のデータファイルに書き出します。これらのデータファイルをストレージシステムにアップロードし、そこからデータウェアハウスへコピーします。Amazon Redshift の場合、たとえばストレージシステムは S3 になります。
最初のステップは、正しい形式でファイルを書き出すことです。この演習では Apache Parquet 形式を選びます。
ワークスペースには、PySpark の DataFrame film_sdf と pandas の DataFrame film_pdf が用意されています。
この演習はコースの一部です
データエンジニアリング入門
演習の手順
pandasの DataFramefilm_pdfを、"films_pdf.parquet"という名前の Parquet ファイルに書き出してください。- PySpark の DataFrame
film_sdfを、"films_sdf.parquet"という名前の Parquet ファイルに書き出してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")