Chọn số lượng hàng xóm
k-Nearest-Neighbors (hay kNN) là phương pháp nội suy điền giá trị thiếu của một quan sát dựa trên giá trị từ k quan sát khác giống nó nhất. Số lượng các quan sát tương tự này, gọi là hàng xóm, là một tham số cần chọn trước.
Chọn k như thế nào? Một cách là thử các giá trị khác nhau và xem chúng ảnh hưởng ra sao đến mối quan hệ giữa dữ liệu đã nội suy và dữ liệu quan sát được.
Hãy thử nội suy humidity trong dữ liệu tao với ba giá trị k khác nhau và xem các giá trị nội suy khớp thế nào với quan hệ giữa humidity và sea_surface_temp.
Bài tập này là một phần của khóa học
Xử lý dữ liệu khuyết bằng Imputation trong R
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Impute humidity using 30 neighbors
tao_imp <- ___(tao, k = ___, variable = ___)
# Draw a margin plot of sea_surface_temp vs humidity
tao_imp %>%
select(sea_surface_temp, humidity, humidity_imp) %>%
___(delimiter = "imp", main = "k = 30")