Zacznij terazZacznij za darmo

Ustawianie niestandardowych wartości NA

Eksploracja i czyszczenie danych obejmują między innymi sprawdzanie brakujących wartości i wartości NA oraz decydowanie, jak sobie z nimi radzić. Jest to łatwiejsze, gdy brakujące wartości traktowane są jako odrębny typ danych – biblioteka pandas udostępnia funkcje, które działają właśnie na takich wartościach NA. Pandas automatycznie rozpoznaje niektóre wartości jako brakujące, ale za pomocą argumentu na_values możesz wskazać dodatkowe wskaźniki NA. W tym ćwiczeniu zrobisz to, aby nieprawidłowe kody pocztowe w danych podatkowych stanu Vermont były kodowane jako NA.

pandas zostało zaimportowane jako pd.

To ćwiczenie jest częścią kursu

Sprawne importowanie danych z pandas

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz słownik null_values, który określi, że wartości 0 w kolumnie zipcode mają być traktowane jako NA.
  • Wczytaj plik vt_tax_data_2016.csv, używając argumentu na_values i tego słownika, aby nieprawidłowe kody pocztowe były traktowane jako brakujące.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create dict specifying that 0s in zipcode are NA values
null_values = {____}

# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv", 
                   ____)

# View rows with NA ZIP codes
print(data[data.zipcode.isna()])
Edytuj i uruchom kod