Astuces kNN I : pondérer les donneurs
Une variante souvent utilisée de l'imputation kNN applique ce qu'on appelle l'agrégation pondérée par la distance. Concrètement, lorsque nous agrégeons les valeurs des voisins pour remplacer une valeur manquante, nous utilisons la moyenne pondérée, et les poids correspondent aux distances inversées de chaque voisin. Ainsi, les voisins les plus proches ont plus d'influence sur la valeur imputée.
Dans cet exercice, vous appliquerez l'agrégation pondérée par la distance lors de l'imputation des données tao. Il suffit de passer deux arguments supplémentaires à la fonction kNN(). Essayons!
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Instructions de l’exercice
- Chargez le paquet
VIM. - Imputez
humidityavec kNN en utilisant une moyenne pondérée par la distance pour agréger les voisins; vous devrez préciser les argumentsnumFunetweightDist. - Le diagramme marginal pour visualiser les résultats a déjà été codé pour vous.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the VIM package
___(___)
# Impute humidity with kNN using distance-weighted mean
tao_imp <- ___(tao,
k = 5,
variable = "humidity",
___ = ___,
___ = ___)
tao_imp %>%
select(sea_surface_temp, humidity, humidity_imp) %>%
marginplot(delimiter = "imp")