Wybór liczby sąsiadów
Imputacja k-Najbliższych Sąsiadów (kNN) uzupełnia brakujące wartości w obserwacji na podstawie wartości pochodzących z k innych obserwacji, które są do niej najbardziej podobne. Liczba tych podobnych obserwacji – zwanych sąsiadami – jest parametrem, który należy wybrać z góry.
Jak dobrać k? Jednym ze sposobów jest wypróbowanie różnych wartości i sprawdzenie, jak wpływają na zależności między imputowanymi a obserwowanymi danymi.
Spróbujmy uzupełnić humidity w zbiorze danych tao przy użyciu trzech różnych wartości k i sprawdźmy, jak imputowane wartości pasują do relacji między humidity a sea_surface_temp.
To ćwiczenie jest częścią kursu
Obsługa brakujących danych z imputacją w R
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Impute humidity using 30 neighbors
tao_imp <- ___(tao, k = ___, variable = ___)
# Draw a margin plot of sea_surface_temp vs humidity
tao_imp %>%
select(sea_surface_temp, humidity, humidity_imp) %>%
___(delimiter = "imp", main = "k = 30")