Définir des valeurs NA personnalisées
Une partie de l'exploration et du nettoyage des données consiste à repérer les valeurs manquantes (NA) et à décider comment les traiter. C'est plus simple lorsque les valeurs manquantes sont considérées comme un type de données à part, et il existe des fonctions pandas qui ciblent précisément ces valeurs NA. pandas considère automatiquement certaines valeurs comme manquantes, mais on peut fournir d'autres indicateurs de NA grâce au paramètre na_values. Ici, vous allez l'utiliser pour vous assurer que les codes postaux (ZIP) invalides dans les données fiscales du Vermont sont codés comme NA.
pandas a été importé sous le nom pd.
Cette activité fait partie du cours
Ingestion de données rationalisée avec pandas
Instructions de l’exercice
- Créez un dictionnaire,
null_values, qui indique que les0de la colonnezipcodedoivent être considérés comme des valeurs NA. - Chargez
vt_tax_data_2016.csven utilisant l'argumentna_valueset le dictionnaire afin que les codes postaux invalides soient traités comme manquants.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create dict specifying that 0s in zipcode are NA values
null_values = {____}
# Load csv using na_values keyword argument
data = pd.read_csv("vt_tax_data_2016.csv",
____)
# View rows with NA ZIP codes
print(data[data.zipcode.isna()])