Bắt đầu ngayBắt đầu miễn phí

Dùng KNN imputation

Ở bài trước, bạn đã dùng median imputation để điền các giá trị thiếu trong bộ dữ liệu ung thư vú, nhưng đó không phải là cách duy nhất để xử lý dữ liệu thiếu.

Một phương án khác là k-nearest neighbors (KNN) imputation. Đây là cách nội suy nâng cao hơn, trong đó các giá trị bị thiếu được thay bằng giá trị từ các hàng khác tương tự với hàng hiện tại. Dù việc triển khai thực tế phức tạp hơn nhiều so với median imputation đơn giản, bạn có thể khám phá rất dễ trong caret bằng cách dùng đối số preProcess của train(). Bạn chỉ cần đặt preProcess = "knnImpute" để thay đổi phương pháp nội suy được dùng trước khi huấn luyện mô hình.

Bài tập này là một phần của khóa học

Machine Learning với caret trong R

Xem khóa học

Hướng dẫn bài tập

breast_cancer_xbreast_cancer_y đã được nạp vào không gian làm việc của bạn.

  • Dùng hàm train() để khớp một mô hình glm tên là knn_model cho bộ dữ liệu ung thư vú.
  • Sử dụng KNN imputation để xử lý các giá trị thiếu.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Apply KNN imputation: knn_model
knn_model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print knn_model to console
Chỉnh sửa và Chạy Mã