Skriva en iterator för att läsa in data i delar (1)
Ett annat sätt att hantera data som är för stora för att lagras i minnet är att läsa in filen som DataFrames av en viss storlek – till exempel 100 rader åt gången. Med pandas-paketet (importerat som pd) kan du till exempel skriva pd.read_csv(filename, chunksize=100). Det skapar ett itererbart reader-objekt, vilket innebär att du kan använda next() på det.
I den här övningen läser du in en fil i små DataFrame-delar med hjälp av read_csv(). Du kommer att använda World Banks indikatordatamängd 'ind_pop.csv', som finns i din aktuella katalog, för att undersöka indikatorn för stadsbefolkning i olika länder och år.
Den här övningen är en del av kursen
Python Toolbox
Övningsinstruktioner
- Använd
pd.read_csv()för att läsa in'ind_pop.csv'i delar om 10 rader. Tilldela resultatet tilldf_reader. - Skriv ut de två första delarna från
df_reader.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the pandas package
import pandas as pd
# Initialize reader object: df_reader
df_reader = ____(____, ____)
# Print two chunks
print(____)
print(____)