Nastavení vlastních hodnot NA
Součástí průzkumu a čištění dat je kontrola chybějících hodnot a hodnot NA a rozhodnutí, jak s nimi naložit. Je to jednodušší, když jsou chybějící hodnoty považovány za vlastní datový typ – pandas nabízí funkce, které se na takové hodnoty NA přímo zaměřují. pandas sice automaticky rozpozná některé hodnoty jako chybějící, ale pomocí argumentu na_values můžeme přidat další vlastní indikátory NA. V tomto cvičení to využiješ k tomu, aby neplatná PSČ v datech daňových přiznání z Vermontu byla zakódována jako NA.
pandas je importován jako pd.
Toto cvičení je součástí kurzu
Streamlined Data Ingestion with pandas
Pokyny k cvičení
- Vytvoř slovník
null_values, který určí, že hodnoty0ve sloupcizipcodemají být považovány za NA. - Načti soubor
vt_tax_data_2016.csvs použitím argumentuna_valuesa tohoto slovníku, aby neplatná PSČ byla správně označena jako chybějící.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create dict specifying that 0s in zipcode are NA values
null_values = {____}
# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv",
____)
# View rows with NA ZIP codes
print(data[data.zipcode.isna()])