始める無料で始める

データパイプラインを「チェックポイント」で検証する

この演習では、CSVファイルから税データを抽出し、新しい列を作成し、課税所得の平均に基づいて行をフィルタリングし、データをparquetファイルに保存するデータパイプラインを扱います。

pandaspd として読み込まれており、extract()transform()load() 関数はすでに定義されています。これらの関数を使って、実行の各段階にあるチェックポイントでデータパイプラインを検証します。

この演習はコースの一部です

Python で学ぶ ETL と ELT

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Extract and transform tax_data
raw_tax_data = extract("raw_tax_data.csv")
clean_tax_data = transform(raw_tax_data)

# Check the shape of the raw_tax_data DataFrame, compare to the clean_tax_data DataFrame
print(f"Shape of raw_tax_data: {raw_tax_data.____}")
print(f"Shape of clean_tax_data: {____}")
コードを編集して実行