データパイプラインを「チェックポイント」で検証する
この演習では、CSVファイルから税データを抽出し、新しい列を作成し、課税所得の平均に基づいて行をフィルタリングし、データをparquetファイルに保存するデータパイプラインを扱います。
pandas は pd として読み込まれており、extract()、transform()、load() 関数はすでに定義されています。これらの関数を使って、実行の各段階にあるチェックポイントでデータパイプラインを検証します。
この演習はコースの一部です
Python で学ぶ ETL と ELT
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)
# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")