CommencezCommencez gratuitement

Astuces kNN I : pondérer les donneurs

Une variante souvent utilisée de l'imputation kNN applique ce qu'on appelle l'agrégation pondérée par la distance. Concrètement, lorsque nous agrégeons les valeurs des voisins pour remplacer une valeur manquante, nous utilisons la moyenne pondérée, et les poids correspondent aux distances inversées de chaque voisin. Ainsi, les voisins les plus proches ont plus d'influence sur la valeur imputée.

Dans cet exercice, vous appliquerez l'agrégation pondérée par la distance lors de l'imputation des données tao. Il suffit de passer deux arguments supplémentaires à la fonction kNN(). Essayons!

Cette activité fait partie du cours

Traitement des données manquantes par imputation dans R

Voir le cours

Instructions de l’exercice

  • Chargez le paquet VIM.
  • Imputez humidity avec kNN en utilisant une moyenne pondérée par la distance pour agréger les voisins; vous devrez préciser les arguments numFun et weightDist.
  • Le diagramme marginal pour visualiser les résultats a déjà été codé pour vous.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the VIM package
___(___)

# Impute humidity with kNN using distance-weighted mean
tao_imp <- ___(tao, 
               k = 5, 
               variable = "humidity", 
               ___ = ___,
               ___ = ___)

tao_imp %>% 
	select(sea_surface_temp, humidity, humidity_imp) %>% 
	marginplot(delimiter = "imp")
Modifier et exécuter le code