Dùng KNN imputation
Ở bài trước, bạn đã dùng median imputation để điền các giá trị thiếu trong bộ dữ liệu ung thư vú, nhưng đó không phải là cách duy nhất để xử lý dữ liệu thiếu.
Một phương án khác là k-nearest neighbors (KNN) imputation. Đây là cách nội suy nâng cao hơn, trong đó các giá trị bị thiếu được thay bằng giá trị từ các hàng khác tương tự với hàng hiện tại. Dù việc triển khai thực tế phức tạp hơn nhiều so với median imputation đơn giản, bạn có thể khám phá rất dễ trong caret bằng cách dùng đối số preProcess của train(). Bạn chỉ cần đặt preProcess = "knnImpute" để thay đổi phương pháp nội suy được dùng trước khi huấn luyện mô hình.
Bài tập này là một phần của khóa học
Machine Learning với caret trong R
Hướng dẫn bài tập
breast_cancer_x và breast_cancer_y đã được nạp vào không gian làm việc của bạn.
- Dùng hàm
train()để khớp một mô hìnhglmtên làknn_modelcho bộ dữ liệu ung thư vú. - Sử dụng KNN imputation để xử lý các giá trị thiếu.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Apply KNN imputation: knn_model
knn_model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print knn_model to console