Astuces kNN I : pondérer les donneurs

Une variante souvent utilisée de l’imputation kNN repose sur l’agrégation pondérée par la distance. Concrètement, lorsque nous agrégeons les valeurs des voisins pour remplacer une valeur manquante, nous utilisons la moyenne pondérée, avec comme poids l’inverse des distances de chaque voisin. Ainsi, les voisins les plus proches ont plus d’influence sur la valeur imputée.

Dans cet exercice, vous allez appliquer l’agrégation pondérée par la distance lors de l’imputation des données tao. Il suffit pour cela de passer deux arguments supplémentaires à la fonction kNN(). Essayons !

Cet exercice fait partie du cours

<cours>Gérer les données manquantes avec des imputations en R</cours>

Instructions de l’exercice

Chargez le package VIM.
Imputez humidity avec kNN en utilisant une moyenne pondérée par la distance pour agréger les voisins ; vous devrez spécifier les arguments numFun et weightDist.
Le graphique marginal pour visualiser les résultats a déjà été codé pour vous.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the VIM package
___(___)

# Impute humidity with kNN using distance-weighted mean
tao_imp <- ___(tao, 
               k = 5, 
               variable = "humidity", 
               ___ = ___,
               ___ = ___)

tao_imp %>% 
	select(sea_surface_temp, humidity, humidity_imp) %>% 
	marginplot(delimiter = "imp")

Modifier et exécuter le code

Cet exercice fait partie du cours

<cours>Gérer les données manquantes avec des imputations en R</cours>

AvancéNiveau de compétence

4.8+

Commencer le cours gratuitement

Dans ce chapitre, vous découvrirez pourquoi les données manquantes peuvent poser un risque lors de l’analyse d’un jeu de données. Vous serez présenté aux trois mécanismes de données manquantes et apprendrez à les reconnaître à l’aide de tests statistiques et d’outils de visualisation.

Exercise 1: Données manquantes : ce qui peut mal se passer Exercise 2: Régression linéaire avec des données incomplètes Exercise 3: Analyser la sortie d’une régression Exercise 4: Comparer des modèles Exercise 5: Mécanismes des données manquantes Exercise 6: Reconnaître les mécanismes des données manquantes Exercise 7: Test t pour MAR : préparation des données Exercise 8: t-test pour MAR : interprétation Exercise 9: Visualiser les motifs de données manquantes Exercise 10: Graphique d’agrégation Exercise 11: Diagramme en épine (spine plot)Exercise 12: Graphique en mosaïque

Familiarisez-vous avec la taxonomie des méthodes d’imputation et apprenez trois techniques basées sur un donneur : l’imputation par la moyenne, le hot-deck et l’imputation par k plus proches voisins. Vous verrez ce qui se passe sous le capot pour comprendre leur fonctionnement, puis vous apprendrez à les appliquer à un jeu de données réel sur la météo tropicale. Au passage, vous découvrirez aussi des astuces utiles pour les rendre encore plus efficaces dans vos propres problèmes.

Exercise 1: Imputation par la moyenne Exercise 2: Sentir le danger de l’imputation par la moyenne Exercise 3: Imputation par la moyenne de la température Exercise 4: Évaluer la qualité de l’imputation avec un margin plot Exercise 5: Imputation par hot-deck Exercise 6: Hot-deck simple Exercise 7: Astuces hot-deck I : imputer au sein de domaines Exercise 8: Astuces hot-deck II : trier selon des variables corrélées Exercise 9: Imputation par k plus proches voisins Exercise 10: Choisir le nombre de voisins Exercise 11: Astuces kNN I : pondérer les donneurs

Exercice actuel

Exercise 12: Astuces kNN II : trier les variables

Il est temps d’apprendre à utiliser des modèles statistiques et de Machine Learning, comme la régression linéaire, la régression logistique et les forêts aléatoires, pour imputer des données manquantes. Dans ce chapitre, vous examinerez comment les modèles font leurs prédictions et utiliserez ces connaissances pour tirer les valeurs imputées à partir de distributions conditionnelles. C’est essentiel pour garantir des imputations plus variées et plausibles, plus proches des données réelles.

Exercise 1: Approche d’imputation basée sur des modèles Exercise 2: Imputation par régression linéaire Exercise 3: Initialiser les valeurs manquantes et itérer sur les variables Exercise 4: Détecter la convergence Exercise 5: Reproduire la variabilité des données Exercise 6: Imputation par régression logistique Exercise 7: Tirer depuis une distribution conditionnelle Exercise 8: Imputation basée sur des modèles avec plusieurs types de variables Exercise 9: Imputation par arbres de décision Exercise 10: Imputation avec des random forests Exercise 11: Erreurs d’imputation par variable Exercise 12: Compromis entre vitesse et précision

Les valeurs imputées ne sont pas gravées dans la pierre. Ce ne sont que des estimations, et toute estimation comporte une part d’incertitude. Dans ce dernier chapitre, vous verrez comment le bootstrapping et les équations en chaîne avec le package mice permettent d’intégrer l’incertitude d’imputation dans vos modèles et analyses afin de les rendre plus fiables et plus robustes.

Exercise 1: Imputations multiples par bootstrap Exercise 2: Regrouper l’imputation et la modélisation dans une fonction Exercise 3: Exécuter le bootstrap Exercise 4: Intervalles de confiance par bootstrapping Exercise 5: Imputation multiple par équations en chaîne Exercise 6: Le flux mice : mice - with - pool Exercise 7: Choisir des modèles par défaut Exercise 8: Utiliser une matrice de prédicteurs Exercise 9: Réunir le tout Exercise 10: Analyser les motifs de données manquantes Exercise 11: Imputer et inspecter les variables cibles Exercise 12: Inférence avec des données imputées Exercise 13: Remarques finales