始める無料で始める

売上データを CSV ファイルにロードする

データのロードは、あらゆるデータパイプラインの重要な要素です。これにより、パイプラインの前段で抽出・変換したデータに、データ利用者や後続プロセスが確実にアクセスできるようになります。この演習では、pandaspd としてインポート済み)を使って、変換後の売上データを CSV ファイルにロードする練習をします。あわせて、生データはすでに抽出されており、DataFrame raw_sales_data として利用可能です。

この演習はコースの一部です

Python で学ぶ ETL と ELT

コースを見る

演習の手順

  • raw_sales_data DataFrame を、価格が25ドル未満の項目だけが残るようにフィルタリングします。
  • load() 関数を更新し、変換後の売上データを "transformed_sales_data.csv" という名前のファイルに書き出し、index 列を含めないようにします。
  • クリーニング済みの DataFrame に対して load() 関数を呼び出します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

def transform(raw_data):
	# Find the items prices less than 25 dollars
	return raw_data.loc[raw_data["Price Each"] ____ ____, ["Order ID", "Product", "Price Each", "Order Date"]]

def load(clean_data):
	# Write the data to a CSV file without the index column
	____.____("transformed_sales_data.csv", index=____)


clean_sales_data = transform(raw_sales_data)

# Call the load function on the cleaned DataFrame
____(____)
コードを編集して実行