Random Forest Classifier - ส่วนที่ 1
มาสร้าง random forest classifier ตัวแรกสำหรับการตรวจจับการฉ้อโกงกัน เป้าหมายคือทำให้ได้ผลดีกว่าความแม่นยำของ baseline ที่คำนวณไปก่อนหน้านี้ ซึ่งอยู่ที่ประมาณ 96% โมเดลนี้จะทำหน้าที่เป็น "โมเดล baseline" ที่จะนำมาปรับปรุงในแบบฝึกหัดถัดไป เริ่มต้นด้วยการ แบ่งข้อมูลออกเป็นชุดทดสอบและชุดฝึก แล้วจึง กำหนดโมเดล Random Forest โดยข้อมูลที่มีอยู่ได้แก่ฟีเจอร์ X และป้ายกำกับ y
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
- นำเข้า random forest classifier จาก
sklearn - แบ่งฟีเจอร์
Xและป้ายกำกับyออกเป็นชุดฝึกและชุดทดสอบ โดยแบ่งข้อมูล 30% ไว้สำหรับชุดทดสอบ - กำหนด random forest classifier ให้กับตัวแปร
modelและตั้งค่าrandom_stateเป็น 5 การกำหนด random state นี้จำเป็นสำหรับการเปรียบเทียบผลลัพธ์ระหว่างโมเดลต่าง ๆ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the random forest model from sklearn
from sklearn.ensemble import ____
# Split your data into training and test set
X_train, X_test, y_train, y_test = ____(____, ____, test_size=____, random_state=0)
# Define the model as the random forest
model = ____(random_state=5)