เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ใช้ KNN imputation

ในแบบฝึกหัดก่อนหน้า คุณใช้ median imputation เพื่อเติมค่าที่หายไปในชุดข้อมูลมะเร็งเต้านม แต่นั่นไม่ใช่วิธีเดียวในการจัดการกับข้อมูลที่ขาดหายไป

อีกทางเลือกหนึ่งคือ k-nearest neighbors หรือ KNN imputation ซึ่งเป็นการ imputation ในรูปแบบที่ซับซ้อนกว่า โดยค่าที่หายไปจะถูกแทนที่ด้วยค่าจากแถวอื่นที่มีลักษณะคล้ายคลึงกับแถวปัจจุบัน แม้ว่าวิธีนี้จะซับซ้อนกว่า median imputation แบบธรรมดามาก แต่สามารถลองใช้ได้ง่ายมากใน caret ผ่านอาร์กิวเมนต์ preProcess ของ train() เพียงระบุ preProcess = "knnImpute" เพื่อเปลี่ยนวิธี imputation ที่ใช้ก่อนการฝึกโมเดล

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Machine Learning ด้วย caret ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

breast_cancer_x และ breast_cancer_y ถูกโหลดไว้ใน workspace แล้ว

  • ใช้ฟังก์ชัน train() เพื่อฝึกโมเดล glm ชื่อ knn_model กับชุดข้อมูลมะเร็งเต้านม
  • ใช้ KNN imputation เพื่อจัดการกับค่าที่หายไป

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Apply KNN imputation: knn_model
knn_model <- train(
  x = ___, 
  y = ___,
  method = ___,
  trControl = myControl,
  preProcess = ___
)

# Print knn_model to console
แก้ไขและรันโค้ด