始める無料で始める

データパイプラインのアーキテクチャパターン

データパイプラインを作成するときは、関数を定義するファイルと、それらを実行するファイルを分けるのがベストプラクティスです。

この演習では、パイプラインのコンポーネントを実行前にメモリへインポートし、その関数を使ってパイプラインをエンドツーエンドで動かす練習をします。プロジェクトは次の構成になっており、pipeline_utils にパイプライン実行で使用する extract()transform()load() 関数が保存されています。

> ls
 etl_pipeline.py
 pipeline_utils.py

この演習はコースの一部です

Python で学ぶ ETL と ELT

コースを見る

演習の手順

  • pipeline_utils モジュールから extracttransformload 関数をインポートします。
  • インポートした関数を使って、データパイプラインをエンドツーエンドで実行します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the extract, transform, and load functions from pipeline_utils
____

# Run the pipeline end to end by extracting, transforming and loading the data
raw_tax_data = ____("raw_tax_data.csv")
clean_tax_data = ____(raw_tax_data)
____(clean_tax_data, "clean_tax_data.parquet")
コードを編集して実行