เลือกโมเดลที่ดีที่สุด
ในแบบฝึกหัดนี้ จะได้เปรียบเทียบ classifier หลายตัวและเลือกตัวที่ทำงานได้ดีที่สุด
ชุดข้อมูลที่ใช้ — โหลดและแบ่งเป็น train set และ test set แล้ว — เป็นข้อมูลของ Pokémon ประกอบด้วยค่าสถิติ ประเภท และตัวแปรที่บอกว่า Pokémon ตัวนั้นเป็นระดับตำนานหรือไม่ เป้าหมายของ classifier คือการพยากรณ์ตัวแปร 'Legendary' นี้
มี classifier แต่ละตัวที่ฝึกกับ training set แล้ว 3 ตัว ดังนี้:
clf_lrคือ logistic regressionclf_dtคือ decision treeclf_knnคือ 5-nearest neighbors classifier
เนื่องจากคลาสในชุดข้อมูลนี้ไม่สมดุล — มีเพียง 65 ตัวจาก Pokémon ทั้งหมด 800 ตัวที่เป็นระดับตำนาน — จึงใช้ F1-Score ในการวัดประสิทธิภาพ โดย f1_score() ของ scikit-learn ถูก import มาให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Ensemble Methods ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Predict the labels of the test set
pred_lr = ____
pred_dt = ____
pred_knn = ____