始める無料で始める

乱雑な CSV の解析

あるサードパーティの電子書籍ベンダーが、シアトルのデジタル貸出データをセミコロン区切りの CSV 形式でエクスポートしています。このファイルでは、本来のヘッダー行の上に 2 行のメタデータ行が含まれています。チームがきれいなテーブルをプレビューできるよう、このレイアウトに対応したスキャン設定を行いましょう。

polarspl としてロード済みです。ベンダーファイルのパスは MESSY_CSV_PATH に格納されています。

この演習はコースの一部です

Polars によるデータパイプラインのスケーリングと最適化

コースを見る

演習の手順

  • ヘッダーの上にある 2 行のメタデータ行をスキップします。
  • 列の区切り文字がセミコロンであることを Polars に指定します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

result = pl.scan_csv(
    MESSY_CSV_PATH,
    # Skip the 2 metadata rows above the header
    skip_rows=____,
    # Columns are separated by semicolons
    separator="____",
).head(5).collect()
print(result)
コードを編集して実行