ใช้ KNN imputation
ในแบบฝึกหัดก่อนหน้า คุณใช้ median imputation เพื่อเติมค่าที่หายไปในชุดข้อมูลมะเร็งเต้านม แต่นั่นไม่ใช่วิธีเดียวในการจัดการกับข้อมูลที่ขาดหายไป
อีกทางเลือกหนึ่งคือ k-nearest neighbors หรือ KNN imputation ซึ่งเป็นการ imputation ในรูปแบบที่ซับซ้อนกว่า โดยค่าที่หายไปจะถูกแทนที่ด้วยค่าจากแถวอื่นที่มีลักษณะคล้ายคลึงกับแถวปัจจุบัน แม้ว่าวิธีนี้จะซับซ้อนกว่า median imputation แบบธรรมดามาก แต่สามารถลองใช้ได้ง่ายมากใน caret ผ่านอาร์กิวเมนต์ preProcess ของ train() เพียงระบุ preProcess = "knnImpute" เพื่อเปลี่ยนวิธี imputation ที่ใช้ก่อนการฝึกโมเดล
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ด้วย caret ใน R
คำแนะนำการฝึกหัด
breast_cancer_x และ breast_cancer_y ถูกโหลดไว้ใน workspace แล้ว
- ใช้ฟังก์ชัน
train()เพื่อฝึกโมเดลglmชื่อknn_modelกับชุดข้อมูลมะเร็งเต้านม - ใช้ KNN imputation เพื่อจัดการกับค่าที่หายไป
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Apply KNN imputation: knn_model
knn_model <- train(
x = ___,
y = ___,
method = ___,
trControl = myControl,
preProcess = ___
)
# Print knn_model to console