การพยากรณ์ความน่าจะเป็นของการผิดนัดชำระ
การเตรียมข้อมูลเสร็จสมบูรณ์แล้ว ถึงเวลาเริ่มสร้างการพยากรณ์ความน่าจะเป็นของการผิดนัดชำระ โดยจะเทรนโมเดล LogisticRegression() บนชุดข้อมูล แล้วตรวจสอบว่าโมเดลพยากรณ์ความน่าจะเป็นของการผิดนัดชำระอย่างไร
เพื่อให้เข้าใจผลลัพธ์ที่ได้จาก predict_proba ได้ชัดเจนยิ่งขึ้น ลองดูตัวอย่างข้อมูลพร้อมกับค่าความน่าจะเป็นที่พยากรณ์ได้ — การพยากรณ์ 5 รายการแรกเป็นอย่างไรเมื่อเทียบกับค่าจริงของ loan_status?
ชุดข้อมูล cr_loan_prep พร้อมด้วย X_train, X_test, y_train และ y_test ถูกโหลดไว้ใน workspace แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้างโมเดลความเสี่ยงด้านเครดิตด้วย Python
คำแนะนำการฝึกหัด
- เทรนโมเดล logistic regression บนข้อมูลเทรน แล้วเก็บไว้ในตัวแปร
clf_logistic - ใช้
predict_proba()กับข้อมูลทดสอบเพื่อสร้างผลการพยากรณ์ แล้วเก็บไว้ในpreds - สร้าง data frame สองชุดคือ
preds_dfและtrue_dfเพื่อเก็บผลการพยากรณ์และค่าจริงของloan_statusจาก 5 แถวแรก - แสดงผล
true_dfและpreds_dfรวมกันโดยใช้.concat()
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Train the logistic regression model on the training data
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Create predictions of probability for loan status using test data
____ = clf_logistic.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([true_df.reset_index(drop = True), preds_df], axis = 1))