Načítání souboru po částech
Při práci s velkými soubory je často jednodušší načítat a zpracovávat data postupně po částech. Procvičíme si tento přístup na datech z daňových přiznání státu Vermont.
Prvních 500 řádků už je načtených jako vt_data_first500. Teď načteš dalších 500 řádků. K tomu využiješ několik pojmenovaných argumentů: nrows a skiprows pro výběr správných záznamů, header, kterým pandas sdělíš, že data nemají názvy sloupců, a names pro jejich doplnění. Názvy sloupců získáš z vt_data_first500 pomocí funkce list().
pandas je naimportován jako pd.
Toto cvičení je součástí kurzu
Streamlined Data Ingestion with pandas
Pokyny k cvičení
- Pomocí
nrowsaskiprowsvytvoř dataframevt_data_next500obsahující dalších 500 řádků. - Nastav argument
headertak, abypandasvěděl, že data neobsahují řádek se záhlavím. - Pojmenuj sloupce v
vt_data_next500tak, že argumentunamespředáš seznam sloupců zvt_data_first500.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())