Tworzenie iteratora do wczytywania danych we fragmentach (1)
Innym sposobem na wczytywanie danych zbyt dużych, by zmieścić się w pamięci, jest odczytywanie pliku partiami w postaci DataFrame'ów o określonej liczbie wierszy – na przykład po 100. Korzystając z biblioteki pandas (importowanej jako pd), możesz użyć pd.read_csv(filename, chunksize=100). Tworzy to iterowalny obiekt reader, na którym możesz wywołać next().
W tym ćwiczeniu wczytasz plik w małych fragmentach jako DataFrame'y, używając read_csv(). Posłużysz się danymi World Bank Indicators z pliku 'ind_pop.csv', dostępnego w bieżącym katalogu, żeby przyjrzeć się wskaźnikowi urbanizacji dla różnych krajów i lat.
To ćwiczenie jest częścią kursu
Zestaw narzędzi Pythona
Instrukcje do ćwiczenia
- Użyj
pd.read_csv(), aby wczytać plik'ind_pop.csv'we fragmentach po 10 wierszy. Przypisz wynik do zmiennejdf_reader. - Wyświetl pierwsze dwa fragmenty z
df_reader.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the pandas package
import pandas as pd
# Initialize reader object: df_reader
df_reader = ____(____, ____)
# Print two chunks
print(____)
print(____)