ใช้การจำแนกประเภทด้วย ML เพื่อตรวจจับการฉ้อโกง
ในแบบฝึกหัดนี้ เราจะลองใช้โมเดล machine learning แบบง่ายกับข้อมูลบัตรเครดิตของเรา แล้วดูว่าผลลัพธ์จะเป็นอย่างไร
คิดว่าจะทำได้ดีกว่าเดิมไหม? ลองนึกดูว่าก่อนหน้านี้พยากรณ์ได้ถูกต้อง 22 จาก 50 กรณีการฉ้อโกง และมี false positive 16 รายการ
ด้วยเหตุนี้ เราจะมาสร้างโมเดล Logistic Regression กัน หากเคยเรียน supervised learning ใน Python มาแล้ว น่าจะคุ้นเคยกับโมเดลนี้ดี แต่ถ้ายังไม่เคย ไม่ต้องกังวล เพราะจะมีคำแนะนำตลอดกระบวนการ
ตัวแปร X และ y พร้อมใช้งานใน workspace แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
- แบ่ง
Xและyเป็นข้อมูลสำหรับ training และ test โดยสำรองข้อมูลไว้สำหรับทดสอบ 30% - Fit โมเดลกับข้อมูล training
- รับ label ที่โมเดลพยากรณ์โดยรัน
model.predictกับX_test - สร้าง classification report เปรียบเทียบ
y_testกับpredictedแล้วใช้ confusion matrix ที่เตรียมไว้ตรวจสอบผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create the training and testing sets
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=____, random_state=0)
# Fit a logistic regression model to our data
model = LogisticRegression()
model.fit(____, ____)
# Obtain model predictions
predicted = model.predict(____)
# Print the classifcation report and confusion matrix
print('Classification report:\n', classification_report(____, ____))
conf_mat = confusion_matrix(y_true=y_test, y_pred=predicted)
print('Confusion matrix:\n', conf_mat)