การสร้างชุดข้อมูลสำหรับการฝึกและการทดสอบ
ตอนนี้คุณได้ฝึกโมเดล LogisticRegression() บนคอลัมน์ต่าง ๆ แล้ว
ข้อมูลควรถูกแบ่งออกเป็นชุดฝึก (training set) และชุดทดสอบ (test set) โดยใช้ train_test_split() เพื่อสร้างทั้งสองชุดพร้อมกัน ชุดฝึกใช้สำหรับการสร้างการทำนาย ส่วนชุดทดสอบใช้สำหรับการประเมินผล หากไม่มีการประเมินโมเดล จะไม่มีทางรู้ได้เลยว่าโมเดลจะทำงานได้ดีเพียงใดกับข้อมูลสินเชื่อชุดใหม่
นอกจาก intercept_ ซึ่งเป็น attribute ของโมเดลแล้ว โมเดล LogisticRegression() ยังมี attribute ที่ชื่อว่า .coef_ ด้วย ค่านี้แสดงให้เห็นว่าแต่ละคอลัมน์ที่ใช้ฝึกมีความสำคัญเพียงใดในการทำนายความน่าจะเป็นของการผิดนัดชำระหนี้
ชุดข้อมูล cr_loan_clean ถูกโหลดไว้ใน workspace แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้างโมเดลความเสี่ยงด้านเครดิตด้วย Python
คำแนะนำการฝึกหัด
- สร้างชุดข้อมูล
Xโดยใช้อัตราดอกเบี้ย ระยะเวลาการจ้างงาน และรายได้ จากนั้นสร้างชุดyโดยใช้สถานะสินเชื่อ - ใช้
train_test_split()เพื่อสร้างชุดฝึกและชุดทดสอบจากXและy - สร้างและฝึกโมเดล
LogisticRegression()แล้วเก็บไว้ในตัวแปรชื่อclf_logistic - แสดงค่าสัมประสิทธิ์ของโมเดลโดยใช้
.coef_
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create the X and y data sets
X = ____[[____,____,____]]
y = ____[[____]]
# Use test_train_split to create the training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=.4, random_state=123)
# Create and fit the logistic regression model
____ = ____(solver='lbfgs').____(____, np.ravel(____))
# Print the models coefficients
print(____.coef_)