Astuces kNN II : trier les variables

Comme l’algorithme des k plus proches voisins parcourt les variables du jeu de données pour les imputer, il calcule des distances entre observations en utilisant d’autres variables, dont certaines ont déjà été imputées aux étapes précédentes. Cela signifie que si les variables placées plus tôt dans les données contiennent beaucoup de valeurs manquantes, les calculs de distance suivants s’appuieront sur de nombreuses valeurs imputées. Cela introduit du bruit dans le calcul des distances.

Pour cette raison, il est recommandé de trier les variables par nombre de valeurs manquantes, par ordre croissant, avant d’effectuer l’imputation kNN. Ainsi, chaque calcul de distance repose sur le plus de données observées possible et sur le moins de données imputées.

Mettons cela en pratique sur les données tao !

Cet exercice fait partie du cours

<cours>Gérer les données manquantes avec des imputations en R</cours>

Instructions de l’exercice

Calculez, dans la première partie du pipeline, le nombre de valeurs manquantes dans chaque colonne de tao.
Puis triez les variables par nombre de valeurs manquantes, par ordre croissant, extrayez leurs noms et assignez le résultat à vars_by_NAs.
Utilisez select() pour réorganiser les variables de tao selon l’ordre enregistré dans vars_by_NAs.
Effectuez l’imputation par k plus proches voisins sur les données réordonnées et assignez le résultat à tao_imp.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Get tao variable names sorted by number of NAs
vars_by_NAs <- tao %>%
  ___ %>%
  colSums() %>%
  sort(decreasing = ___) %>% 
  names()

# Sort tao variables and feed it to kNN imputation
tao_imp <- tao %>% 
  select(___) %>% 
  ___()

tao_imp %>% 
	select(sea_surface_temp, humidity, humidity_imp) %>% 
	marginplot(delimiter = "imp")

Modifier et exécuter le code

Cet exercice fait partie du cours

<cours>Gérer les données manquantes avec des imputations en R</cours>

AvancéNiveau de compétence

4.8+

Commencer le cours gratuitement

Dans ce chapitre, vous découvrirez pourquoi les données manquantes peuvent poser un risque lors de l’analyse d’un jeu de données. Vous serez présenté aux trois mécanismes de données manquantes et apprendrez à les reconnaître à l’aide de tests statistiques et d’outils de visualisation.

Exercise 1: Données manquantes : ce qui peut mal se passer Exercise 2: Régression linéaire avec des données incomplètes Exercise 3: Analyser la sortie d’une régression Exercise 4: Comparer des modèles Exercise 5: Mécanismes des données manquantes Exercise 6: Reconnaître les mécanismes des données manquantes Exercise 7: Test t pour MAR : préparation des données Exercise 8: t-test pour MAR : interprétation Exercise 9: Visualiser les motifs de données manquantes Exercise 10: Graphique d’agrégation Exercise 11: Diagramme en épine (spine plot)Exercise 12: Graphique en mosaïque

Familiarisez-vous avec la taxonomie des méthodes d’imputation et apprenez trois techniques basées sur un donneur : l’imputation par la moyenne, le hot-deck et l’imputation par k plus proches voisins. Vous verrez ce qui se passe sous le capot pour comprendre leur fonctionnement, puis vous apprendrez à les appliquer à un jeu de données réel sur la météo tropicale. Au passage, vous découvrirez aussi des astuces utiles pour les rendre encore plus efficaces dans vos propres problèmes.

Exercise 1: Imputation par la moyenne Exercise 2: Sentir le danger de l’imputation par la moyenne Exercise 3: Imputation par la moyenne de la température Exercise 4: Évaluer la qualité de l’imputation avec un margin plot Exercise 5: Imputation par hot-deck Exercise 6: Hot-deck simple Exercise 7: Astuces hot-deck I : imputer au sein de domaines Exercise 8: Astuces hot-deck II : trier selon des variables corrélées Exercise 9: Imputation par k plus proches voisins Exercise 10: Choisir le nombre de voisins Exercise 11: Astuces kNN I : pondérer les donneurs Exercise 12: Astuces kNN II : trier les variables

Exercice actuel

Il est temps d’apprendre à utiliser des modèles statistiques et de Machine Learning, comme la régression linéaire, la régression logistique et les forêts aléatoires, pour imputer des données manquantes. Dans ce chapitre, vous examinerez comment les modèles font leurs prédictions et utiliserez ces connaissances pour tirer les valeurs imputées à partir de distributions conditionnelles. C’est essentiel pour garantir des imputations plus variées et plausibles, plus proches des données réelles.

Exercise 1: Approche d’imputation basée sur des modèles Exercise 2: Imputation par régression linéaire Exercise 3: Initialiser les valeurs manquantes et itérer sur les variables Exercise 4: Détecter la convergence Exercise 5: Reproduire la variabilité des données Exercise 6: Imputation par régression logistique Exercise 7: Tirer depuis une distribution conditionnelle Exercise 8: Imputation basée sur des modèles avec plusieurs types de variables Exercise 9: Imputation par arbres de décision Exercise 10: Imputation avec des random forests Exercise 11: Erreurs d’imputation par variable Exercise 12: Compromis entre vitesse et précision

Les valeurs imputées ne sont pas gravées dans la pierre. Ce ne sont que des estimations, et toute estimation comporte une part d’incertitude. Dans ce dernier chapitre, vous verrez comment le bootstrapping et les équations en chaîne avec le package mice permettent d’intégrer l’incertitude d’imputation dans vos modèles et analyses afin de les rendre plus fiables et plus robustes.

Exercise 1: Imputations multiples par bootstrap Exercise 2: Regrouper l’imputation et la modélisation dans une fonction Exercise 3: Exécuter le bootstrap Exercise 4: Intervalles de confiance par bootstrapping Exercise 5: Imputation multiple par équations en chaîne Exercise 6: Le flux mice : mice - with - pool Exercise 7: Choisir des modèles par défaut Exercise 8: Utiliser une matrice de prédicteurs Exercise 9: Réunir le tout Exercise 10: Analyser les motifs de données manquantes Exercise 11: Imputer et inspecter les variables cibles Exercise 12: Inférence avec des données imputées Exercise 13: Remarques finales