ÎncepețiÎncepe gratuit

Definește valori NA personalizate

O parte din explorarea și curățarea datelor constă în identificarea valorilor lipsă sau NA și în deciderea modului de gestionare a acestora. Procesul este mai simplu atunci când valorile lipsă sunt tratate ca un tip de date propriu, iar pandas oferă funcții dedicate pentru astfel de valori NA. pandas tratează automat anumite valori ca lipsă, însă putem indica valori NA suplimentare prin argumentul na_values. În acest exercițiu, vei folosi această opțiune pentru a te asigura că codurile ZIP invalide din datele fiscale din Vermont sunt codificate ca NA.

pandas a fost importat ca pd.

Acest exercițiu face parte din cursul

Ingestie eficientă a datelor cu pandas

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un dicționar, null_values, care să specifice că valorile 0 din coloana zipcode trebuie considerate valori NA.
  • Încarcă vt_tax_data_2016.csv folosind argumentul na_values și dicționarul creat, pentru a te asigura că codurile ZIP invalide sunt tratate ca valori lipsă.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create dict specifying that 0s in zipcode are NA values
null_values = {____}

# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv", 
                   ____)

# View rows with NA ZIP codes
print(data[data.zipcode.isna()])
Editează și rulează codul