Ange anpassade NA-värden
En del av datautforskning och datarensning handlar om att söka efter saknade värden eller NA-värden och bestämma hur de ska hanteras. Det blir enklare när saknade värden behandlas som en egen datatyp – pandas har funktioner som specifikt riktar sig mot sådana NA-värden. pandas behandlar vissa värden som saknade automatiskt, men du kan även ange ytterligare NA-indikatorer med argumentet na_values. Här gör du detta för att säkerställa att ogiltiga postnummer i Vermonts skattedata kodas som NA.
pandas har importerats som pd.
Den här övningen är en del av kursen
Effektiv datainläsning med pandas
Övningsinstruktioner
- Skapa en ordbok,
null_values, som anger att0-värden i kolumnenzipcodeska betraktas som NA-värden. - Läs in
vt_tax_data_2016.csvmed argumentetna_valuesoch ordboken för att säkerställa att ogiltiga postnummer behandlas som saknade värden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create dict specifying that 0s in zipcode are NA values
null_values = {____}
# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv",
____)
# View rows with NA ZIP codes
print(data[data.zipcode.isna()])