データパイプラインのアーキテクチャパターン
データパイプラインを作成するときは、関数を定義するファイルと、それらを実行するファイルを分けるのがベストプラクティスです。
この演習では、パイプラインのコンポーネントを実行前にメモリへインポートし、その関数を使ってパイプラインをエンドツーエンドで動かす練習をします。プロジェクトは次の構成になっており、pipeline_utils にパイプライン実行で使用する extract()、transform()、load() 関数が保存されています。
> ls
etl_pipeline.py
pipeline_utils.py
この演習はコースの一部です
Python で学ぶ ETL と ELT
演習の手順
pipeline_utilsモジュールからextract、transform、load関数をインポートします。- インポートした関数を使って、データパイプラインをエンドツーエンドで実行します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the extract, transform, and load functions from pipeline_utils
____
# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")