Definește valori NA personalizate
O parte din explorarea și curățarea datelor constă în identificarea valorilor lipsă sau NA și în deciderea modului de gestionare a acestora. Procesul este mai simplu atunci când valorile lipsă sunt tratate ca un tip de date propriu, iar pandas oferă funcții dedicate pentru astfel de valori NA. pandas tratează automat anumite valori ca lipsă, însă putem indica valori NA suplimentare prin argumentul na_values. În acest exercițiu, vei folosi această opțiune pentru a te asigura că codurile ZIP invalide din datele fiscale din Vermont sunt codificate ca NA.
pandas a fost importat ca pd.
Acest exercițiu face parte din cursul
Ingestie eficientă a datelor cu pandas
Instrucțiuni pentru exercițiu
- Creează un dicționar,
null_values, care să specifice că valorile0din coloanazipcodetrebuie considerate valori NA. - Încarcă
vt_tax_data_2016.csvfolosind argumentulna_valuesși dicționarul creat, pentru a te asigura că codurile ZIP invalide sunt tratate ca valori lipsă.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create dict specifying that 0s in zipcode are NA values
null_values = {____}
# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv",
____)
# View rows with NA ZIP codes
print(data[data.zipcode.isna()])