Bắt đầu ngayBắt đầu miễn phí

Chọn số lượng hàng xóm

k-Nearest-Neighbors (hay kNN) là phương pháp nội suy điền giá trị thiếu của một quan sát dựa trên giá trị từ k quan sát khác giống nó nhất. Số lượng các quan sát tương tự này, gọi là hàng xóm, là một tham số cần chọn trước.

Chọn k như thế nào? Một cách là thử các giá trị khác nhau và xem chúng ảnh hưởng ra sao đến mối quan hệ giữa dữ liệu đã nội suy và dữ liệu quan sát được.

Hãy thử nội suy humidity trong dữ liệu tao với ba giá trị k khác nhau và xem các giá trị nội suy khớp thế nào với quan hệ giữa humiditysea_surface_temp.

Bài tập này là một phần của khóa học

Xử lý dữ liệu khuyết bằng Imputation trong R

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Impute humidity using 30 neighbors
tao_imp <- ___(tao, k = ___, variable = ___)

# Draw a margin plot of sea_surface_temp vs humidity
tao_imp %>% 
	select(sea_surface_temp, humidity, humidity_imp) %>% 
	___(delimiter = "imp", main = "k = 30")
Chỉnh sửa và Chạy Mã