乱雑な CSV の解析
あるサードパーティの電子書籍ベンダーが、シアトルのデジタル貸出データをセミコロン区切りの CSV 形式でエクスポートしています。このファイルでは、本来のヘッダー行の上に 2 行のメタデータ行が含まれています。チームがきれいなテーブルをプレビューできるよう、このレイアウトに対応したスキャン設定を行いましょう。
polars は pl としてロード済みです。ベンダーファイルのパスは MESSY_CSV_PATH に格納されています。
この演習はコースの一部です
Polars によるデータパイプラインのスケーリングと最適化
演習の手順
- ヘッダーの上にある 2 行のメタデータ行をスキップします。
- 列の区切り文字がセミコロンであることを Polars に指定します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
result = pl.scan_csv(
MESSY_CSV_PATH,
# Skip the 2 metadata rows above the header
skip_rows=____,
# Columns are separated by semicolons
separator="____",
).head(5).collect()
print(result)