Choisir le nombre de voisins
L'imputation par k plus proches voisins (k-Nearest-Neighbors ou kNN) remplit les valeurs manquantes d'une observation à partir des valeurs provenant des k autres observations qui lui ressemblent le plus. Le nombre de ces observations similaires, appelées voisins, à considérer est un paramètre à choisir à l'avance.
Comment choisir k? Une façon de faire est d'essayer différentes valeurs et d'observer leur effet sur les relations entre les données imputées et les données observées.
Essayons d'imputer humidity dans les données tao avec trois valeurs de k différentes et voyons comment les valeurs imputées s'insèrent dans la relation entre humidity et sea_surface_temp.
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Impute humidity using 30 neighbors
tao_imp <- ___(tao, k = ___, variable = ___)
# Draw a margin plot of sea_surface_temp vs humidity
tao_imp %>%
select(sea_surface_temp, humidity, humidity_imp) %>%
___(delimiter = "imp", main = "k = 30")