Ustawianie niestandardowych wartości NA
Eksploracja i czyszczenie danych obejmują między innymi sprawdzanie brakujących wartości i wartości NA oraz decydowanie, jak sobie z nimi radzić. Jest to łatwiejsze, gdy brakujące wartości traktowane są jako odrębny typ danych – biblioteka pandas udostępnia funkcje, które działają właśnie na takich wartościach NA. Pandas automatycznie rozpoznaje niektóre wartości jako brakujące, ale za pomocą argumentu na_values możesz wskazać dodatkowe wskaźniki NA. W tym ćwiczeniu zrobisz to, aby nieprawidłowe kody pocztowe w danych podatkowych stanu Vermont były kodowane jako NA.
pandas zostało zaimportowane jako pd.
To ćwiczenie jest częścią kursu
Sprawne importowanie danych z pandas
Instrukcje do ćwiczenia
- Utwórz słownik
null_values, który określi, że wartości0w kolumniezipcodemają być traktowane jako NA. - Wczytaj plik
vt_tax_data_2016.csv, używając argumentuna_valuesi tego słownika, aby nieprawidłowe kody pocztowe były traktowane jako brakujące.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create dict specifying that 0s in zipcode are NA values
null_values = {____}
# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv",
____)
# View rows with NA ZIP codes
print(data[data.zipcode.isna()])