Zacznij terazZacznij za darmo

Wybór liczby sąsiadów

Imputacja k-Najbliższych Sąsiadów (kNN) uzupełnia brakujące wartości w obserwacji na podstawie wartości pochodzących z k innych obserwacji, które są do niej najbardziej podobne. Liczba tych podobnych obserwacji – zwanych sąsiadami – jest parametrem, który należy wybrać z góry.

Jak dobrać k? Jednym ze sposobów jest wypróbowanie różnych wartości i sprawdzenie, jak wpływają na zależności między imputowanymi a obserwowanymi danymi.

Spróbujmy uzupełnić humidity w zbiorze danych tao przy użyciu trzech różnych wartości k i sprawdźmy, jak imputowane wartości pasują do relacji między humidity a sea_surface_temp.

To ćwiczenie jest częścią kursu

Obsługa brakujących danych z imputacją w R

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Impute humidity using 30 neighbors
tao_imp <- ___(tao, k = ___, variable = ___)

# Draw a margin plot of sea_surface_temp vs humidity
tao_imp %>% 
	select(sea_surface_temp, humidity, humidity_imp) %>% 
	___(delimiter = "imp", main = "k = 30")
Edytuj i uruchom kod