データをチャンク単位で読み込むイテレータの作成(1)
メモリに収まらない大きなデータをチャンクで読み込む方法として、一定の行数(100 行など)の DataFrame に分けてファイルを読み込む方法があります。たとえば、pandas(pd としてインポート済み)では、pd.read_csv(filename, chunksize=100) と記述します。これにより、イテラブルな reader オブジェクトが生成され、next() を使って順に読み込むことができます。
この演習では、read_csv() を使ってファイルを小さな DataFrame のチャンクに分けて読み込みます。現在のディレクトリにある世界銀行のインジケーターデータ 'ind_pop.csv' を使用して、複数の国と年にわたる都市人口の指標を確認しましょう。
この演習はコースの一部です
Python Toolbox
演習の手順
pd.read_csv()を使って'ind_pop.csv'をチャンクサイズ 10 で読み込み、結果をdf_readerに代入しましょう。df_readerから最初の 2 つのチャンクを出力しましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the pandas package
import pandas as pd
# Initialize reader object: df_reader
df_reader = ____(____, ____)
# Print two chunks
print(____)
print(____)