Logistic Regression แบบหลายตัวแปร
โดยทั่วไปแล้ว การใช้แค่ loan_int_rate เพียงตัวเดียวในการทำนายความน่าจะเป็นของการผิดนัดชำระหนี้นั้นไม่เพียงพอ ควรนำข้อมูลทั้งหมดที่มีมาใช้ในการทำนาย
ด้วยแนวคิดนี้ ลองฝึกโมเดลใหม่โดยใช้คอลัมน์ต่าง ๆ ที่เรียกว่า features จากชุดข้อมูล cr_loan_clean แล้วโมเดลนี้จะแตกต่างจากโมเดลแรกหรือไม่? สามารถตรวจสอบได้ง่าย ๆ ด้วยการดูค่า .intercept_ ของ logistic regression ซึ่งก็คือจุดตัดแกน y ของฟังก์ชัน และแสดงถึง log-odds โดยรวมของการไม่ผิดนัดชำระหนี้
ชุดข้อมูล cr_loan_clean ถูกโหลดไว้ใน workspace แล้ว พร้อมกับโมเดลก่อนหน้า clf_logistic_single
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้างโมเดลความเสี่ยงด้านเครดิตด้วย Python
คำแนะนำการฝึกหัด
- สร้างชุดข้อมูล
Xใหม่โดยใช้loan_int_rateและperson_emp_lengthแล้วเก็บไว้ในตัวแปรX_multi - สร้างชุดข้อมูล
yโดยใช้เฉพาะloan_status - สร้างโมเดล
LogisticRegression()แล้วเรียก.fit()บนชุดข้อมูลXใหม่ จากนั้นเก็บไว้ในตัวแปรclf_logistic_multi - แสดงค่า
.intercept_ของโมเดล
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create X data for the model
X_multi = ____[[____,____]]
# Create a set of y data for training
y = ____[[____]]
# Create and train a new logistic regression
clf_logistic_multi = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the intercept of the model
print(____.____)