始める無料で始める

データをチャンク単位で読み込むイテレータの作成(1)

メモリに収まらない大きなデータをチャンクで読み込む方法として、一定の行数(100 行など)の DataFrame に分けてファイルを読み込む方法があります。たとえば、pandas(pd としてインポート済み)では、pd.read_csv(filename, chunksize=100) と記述します。これにより、イテラブルな reader オブジェクトが生成され、next() を使って順に読み込むことができます。

この演習では、read_csv() を使ってファイルを小さな DataFrame のチャンクに分けて読み込みます。現在のディレクトリにある世界銀行のインジケーターデータ 'ind_pop.csv' を使用して、複数の国と年にわたる都市人口の指標を確認しましょう。

この演習はコースの一部です

Python Toolbox

コースを見る

演習の手順

  • pd.read_csv() を使って 'ind_pop.csv' をチャンクサイズ 10 で読み込み、結果を df_reader に代入しましょう。
  • df_reader から最初の 2 つのチャンクを出力しましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the pandas package
import pandas as pd

# Initialize reader object: df_reader
df_reader = ____(____, ____)

# Print two chunks
print(____)
print(____)
コードを編集して実行