ความสำคัญของคอลัมน์และการพยากรณ์เบื้องต้น
เมื่อใช้ชุดข้อมูลฝึกสอนหลายชุดที่มีกลุ่มคอลัมน์แตกต่างกัน สิ่งสำคัญคือต้องติดตามว่าคอลัมน์ใดมีผลต่อโมเดลและคอลัมน์ใดไม่มี การดูแลรักษาคอลัมน์ที่ไม่ส่งผลต่อการพยากรณ์ loan_status อาจสิ้นเปลืองทั้งเวลาและทรัพยากรโดยไม่จำเป็น
ข้อมูล X สำหรับแบบฝึกหัดนี้สร้างขึ้นด้วยโค้ดต่อไปนี้:
X = cr_loan_prep[['person_income','loan_int_rate',
'loan_percent_income','loan_amnt',
'person_home_ownership_MORTGAGE','loan_grade_F']]
ฝึกโมเดล XGBClassifier() กับข้อมูลชุดนี้ แล้วตรวจสอบความสำคัญของแต่ละคอลัมน์เพื่อดูว่าแต่ละคอลัมน์ช่วยพยากรณ์ loan_status ได้ดีเพียงใด
ชุดข้อมูล cr_loan_pret พร้อมด้วย X_train และ y_train ได้ถูกโหลดไว้ใน workspace แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้างโมเดลความเสี่ยงด้านเครดิตด้วย Python
คำแนะนำการฝึกหัด
- สร้างและฝึกโมเดล
XGBClassifier()บนX_trainและy_trainจากนั้นเก็บไว้ในตัวแปรชื่อclf_gbt - แสดงความสำคัญของคอลัมน์ใน
clf_gbtโดยใช้.get_booster()และ.get_score()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create and train the model on the training data
____ = xgb.____().____(____,np.ravel(____))
# Print the column importances from the model
print(clf_gbt.____().____(importance_type = 'weight'))