Imputer les données manquantes
Vous avez constaté que les colonnes « price » et « building_id » comportent des valeurs manquantes dans l'ensemble de données Rental Listing Inquiries. Avant d'envoyer les données aux modèles, vous devez donc imputer ces valeurs.
La caractéristique numérique « price » sera remplacée par la moyenne des prix non manquants.
Imputer la caractéristique catégorielle « building_id » avec la catégorie la plus fréquente n'est pas une bonne idée : cela reviendrait à dire que tous les appartements sans « building_id » se trouvent dans l'immeuble le plus populaire. Il vaut mieux imputer avec une nouvelle catégorie.
Le DataFrame rental_listings contenant les données de la compétition a été chargé pour vous.
Cette activité fait partie du cours
Remporter une compétition Kaggle en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import SimpleImputer
from sklearn.impute import SimpleImputer
# Create mean imputer
mean_imputer = ____(strategy='____')
# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])