Začněte nyníZačněte zdarma

Nastavení vlastních hodnot NA

Součástí průzkumu a čištění dat je kontrola chybějících hodnot a hodnot NA a rozhodnutí, jak s nimi naložit. Je to jednodušší, když jsou chybějící hodnoty považovány za vlastní datový typ – pandas nabízí funkce, které se na takové hodnoty NA přímo zaměřují. pandas sice automaticky rozpozná některé hodnoty jako chybějící, ale pomocí argumentu na_values můžeme přidat další vlastní indikátory NA. V tomto cvičení to využiješ k tomu, aby neplatná PSČ v datech daňových přiznání z Vermontu byla zakódována jako NA.

pandas je importován jako pd.

Toto cvičení je součástí kurzu

Streamlined Data Ingestion with pandas

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř slovník null_values, který určí, že hodnoty 0 ve sloupci zipcode mají být považovány za NA.
  • Načti soubor vt_tax_data_2016.csv s použitím argumentu na_values a tohoto slovníku, aby neplatná PSČ byla správně označena jako chybějící.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create dict specifying that 0s in zipcode are NA values
null_values = {____}

# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv", 
                   ____)

# View rows with NA ZIP codes
print(data[data.zipcode.isna()])
Upravit a spustit kód