parquet ファイルからのデータ抽出
ソースシステムからデータを取り込む一般的な方法のひとつは、CSV のようなファイルから読み込むことです。データが大規模化するにつれて、より優れたファイル形式が求められ、parquet のような列指向の新しいファイルタイプが登場しました。
この演習では、parquet ファイルからデータを抽出する練習をします。
この演習はコースの一部です
Python で学ぶ ETL と ELT
演習の手順
- パス
"sales_data.parquet"の parquet ファイルをpandasの DataFrame に読み込みます。 print()を使って DataFrame のデータ型を確認します。- DataFrame の形状と先頭行を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
import pandas as pd
# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")
# Check the data type of the columns of the DataFrames
print(sales_data.____)
# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())