เปรียบเทียบ KNN imputation และ median imputation
ขั้นตอนการ preprocessing ทั้งหมดในฟังก์ชัน train() จะเกิดขึ้นในชุดข้อมูล training ของแต่ละ cross-validation fold ดังนั้นค่า error metrics ที่รายงานออกมาจะรวมผลจากขั้นตอน preprocessing ไว้ด้วย
ซึ่งรวมถึงวิธีการ imputation ที่ใช้ (เช่น knnImpute หรือ medianImpute) ข้อดีคือสามารถเปรียบเทียบวิธีการ imputation ต่าง ๆ และเลือกวิธีที่ให้ประสิทธิภาพดีที่สุดบนข้อมูลนอกกลุ่มตัวอย่างได้
median_model และ knn_model พร้อมใช้งานใน workspace รวมถึง resamples ซึ่งเก็บผลการ resampling ของทั้งสองโมเดล ดูผลลัพธ์ของโมเดลโดยเรียกใช้คำสั่ง
dotplot(resamples, metric = "ROC")
แล้วเลือกวิธีที่ให้ประสิทธิภาพดีที่สุดบนข้อมูลนอกกลุ่มตัวอย่าง วิธีการ imputation แบบใดที่ให้คะแนน ROC นอกกลุ่มตัวอย่างสูงที่สุดสำหรับโมเดล glm ของคุณ?
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning ด้วย caret ใน R
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด