สำรวจ Hyperparameter ของ Random Forest
การทำความเข้าใจว่ามี hyperparameter ใดบ้างและแต่ละตัวส่งผลอย่างไรต่อโมเดล ถือเป็นทักษะสำคัญของนักวิทยาศาสตร์ข้อมูลทุกคน เมื่อโมเดลมีความซับซ้อนมากขึ้น ก็จะมีค่าที่ปรับได้มากขึ้นตามไปด้วย แต่มีเพียงบางตัวเท่านั้นที่ส่งผลกระทบอย่างมีนัยสำคัญ
ในแบบฝึกหัดนี้ จะได้ประเมินโมเดล random forest ที่มีอยู่ (ซึ่งตั้ง hyperparameter ไว้ไม่ดีนัก!) จากนั้นจึงเลือกค่าที่ดีกว่าสำหรับโมเดลใหม่และประเมินประสิทธิภาพของมัน
ข้อมูลที่มีให้:
- DataFrame
X_train,X_test,y_train,y_test - โมเดล random forest ที่ฝึกไว้แล้ว
rf_clf_old - ผลการพยากรณ์ของโมเดลเดิมบนชุดทดสอบ
rf_old_predictions
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การปรับ Hyperparameter ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print out the old estimator, notice which hyperparameter is badly set
print(____)
# Get confusion matrix & accuracy for the old rf_model
print("Confusion Matrix: \n\n {} \n Accuracy Score: \n\n {}".format(
confusion_matrix(____, ____),
accuracy_score(____, ____)))