CommencezCommencez gratuitement

Imputation KNN

Les jeux de données contiennent souvent des variables corrélées. Il est donc important d'en tenir compte pour imputer les valeurs manquantes. Les modèles de Machine Learning utilisent les variables du DataFrame pour repérer des corrélations et des motifs, puis prédire une variable donnée.

L'un des modèles les plus simples et efficaces est K Nearest Neighbors. Il repère les « K » points les plus similaires aux points existants pour imputer les valeurs manquantes.

Dans cet exercice, le DataFrame diabetes a déjà été chargé pour vous. Utilisez le paquet fancyimpute pour imputer les valeurs manquantes dans le DataFrame diabetes.

Cette activité fait partie du cours

Gérer les données manquantes avec Python

Voir le cours

Instructions de l’exercice

  • Importez KNN depuis fancyimpute.
  • Copiez diabetes dans diabetes_knn_imputed.
  • Créez un objet KNN() et assignez-le à knn_imputer.
  • Imputez le DataFrame diabetes_knn_imputed.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import KNN from fancyimpute
___

# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___

# Initialize KNN
knn_imputer = ___

# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___
Modifier et exécuter le code