始める無料で始める

parquet ファイルからのデータ抽出

ソースシステムからデータを取り込む一般的な方法のひとつは、CSV のようなファイルから読み込むことです。データが大規模化するにつれて、より優れたファイル形式が求められ、parquet のような列指向の新しいファイルタイプが登場しました。

この演習では、parquet ファイルからデータを抽出する練習をします。

この演習はコースの一部です

Python で学ぶ ETL と ELT

コースを見る

演習の手順

  • パス "sales_data.parquet" の parquet ファイルを pandas の DataFrame に読み込みます。
  • print() を使って DataFrame のデータ型を確認します。
  • DataFrame の形状と先頭行を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

import pandas as pd

# Read the sales data into a DataFrame
sales_data = pd.____("____", engine="fastparquet")

# Check the data type of the columns of the DataFrames
print(sales_data.____)

# Print the shape of the DataFrame, as well as the head
print(sales_data.____)
print(sales_data.____())
コードを編集して実行