เปรียบเทียบรายงานของแต่ละโมเดล
เราได้ใช้ทั้ง logistic regression และ gradient boosted trees ไปแล้ว ถึงเวลาเปรียบเทียบโมเดลทั้งสองเพื่อตัดสินใจว่าจะใช้โมเดลใดสำหรับการทำนายขั้นสุดท้าย
วิธีเริ่มต้นที่ง่ายที่สุดในการเปรียบเทียบความสามารถของโมเดลในการทำนายความน่าจะเป็นของการผิดนัดชำระหนี้ คือการดูเมตริกจาก classification_report() ซึ่งจะแสดงคะแนนหลายตัวเคียงกันสำหรับแต่ละโมเดล เนื่องจากข้อมูลและโมเดลมักไม่สมดุล โดยมีกรณี default น้อย ตอนนี้ให้เน้นไปที่เมตริกสำหรับ default เป็นหลัก
โมเดลที่ฝึกแล้ว clf_logistic และ clf_gbt ถูกโหลดเข้า workspace พร้อมกับผลการทำนาย preds_df_lr และ preds_df_gbt โดยใช้ค่า cutoff ที่ 0.4 สำหรับทั้งสองโมเดล และชุดข้อมูลทดสอบ y_test ก็พร้อมใช้งานด้วย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้างโมเดลความเสี่ยงด้านเครดิตด้วย Python
คำแนะนำการฝึกหัด
- แสดงผล
classification_report()สำหรับการทำนายของ logistic regression - แสดงผล
classification_report()สำหรับการทำนายของ gradient boosted tree - แสดงค่า
macro averageของ F-1 Score สำหรับ logistic regression โดยใช้precision_recall_fscore_support() - แสดงค่า
macro averageของ F-1 Score สำหรับ gradient boosted tree โดยใช้precision_recall_fscore_support()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print the logistic regression classification report
target_names = ['Non-Default', 'Default']
print(____(____, ____['loan_status'], target_names=target_names))
# Print the gradient boosted tree classification report
print(____(____, ____['loan_status'], target_names=target_names))
# Print the default F-1 scores for the logistic regression
print(____(____,____['loan_status'], average = 'macro')[2])
# Print the default F-1 scores for the gradient boosted tree
print(____(____,____['loan_status'], average = 'macro')[2])