選擇鄰居數量
k-Nearest-Neighbors(或 kNN)插補會根據與某筆觀測最相似的其他 k 筆觀測,其變數值來填補該觀測中的遺漏值。要納入考量的這些相似觀測(稱為「鄰居」)的數量,是必須事先決定的參數。
要怎麼選 k?一種作法是嘗試不同數值,看看它們如何影響插補後資料與已觀測資料之間的關係。
現在來用三個不同的 k 值為 tao 資料中的 humidity 做插補,並觀察插補值與 humidity 和 sea_surface_temp 之間關係的貼合程度。
本練習屬於課程
在 R 中以插補處理遺漏值
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Impute humidity using 30 neighbors
tao_imp <- ___(tao, k = ___, variable = ___)
# Draw a margin plot of sea_surface_temp vs humidity
tao_imp %>%
select(sea_surface_temp, humidity, humidity_imp) %>%
___(delimiter = "imp", main = "k = 30")