การเลือกคอลัมน์และประสิทธิภาพของโมเดล
การสร้างชุดข้อมูลฝึกสอนจากการเลือกคอลัมน์ที่แตกต่างกันส่งผลต่อโมเดลและค่าความสำคัญของคอลัมน์ แล้วการเลือกคอลัมน์ที่ต่างกันจะส่งผลต่อค่า F-1 score ซึ่งเป็นการรวมกันของ precision และ recall ด้วยหรือไม่? คำถามนี้ตอบได้โดยการฝึกโมเดลสองตัวบนชุดคอลัมน์ที่ต่างกัน แล้วตรวจสอบประสิทธิภาพของแต่ละโมเดล
การทำนายว่าเป็น non-default ทั้งที่จริงแล้วเป็น default อาจก่อให้เกิดความสูญเสียที่ไม่คาดคิด หากความน่าจะเป็นของการผิดนัดชำระหนี้ของสินเชื่อเหล่านั้นต่ำมาก คุณสามารถใช้ F-1 score สำหรับ default เพื่อดูว่าโมเดลทำนาย default ได้แม่นยำเพียงใด
ข้อมูลเครดิต cr_loan_prep และชุดคอลัมน์สำหรับฝึกสอนสองชุดคือ X และ X2 ถูกโหลดไว้ในพื้นที่ทำงานแล้ว โมเดล gbt และ gbt2 ได้รับการฝึกสอนเรียบร้อยแล้วเช่นกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้างโมเดลความเสี่ยงด้านเครดิตด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Predict the loan_status using each model
____ = gbt.____(____)
____ = gbt2.____(____)
# Print the classification report of the first model
target_names = ['Non-Default', 'Default']
print(____(____, ____, target_names=target_names))
# Print the classification report of the second model
print(____(____, ____, target_names=target_names))