K-means Clustering
อัลกอริทึม Clustering ที่ได้รับความนิยมอย่างมากคือ K-means Clustering ในการตรวจจับการทุจริต K-means Clustering นำไปใช้งานได้ไม่ซับซ้อนและมีประสิทธิภาพพอสมควรในการพยากรณ์กรณีที่น่าสงสัย จึงเป็นอัลกอริทึมที่เหมาะสำหรับจุดเริ่มต้นในงานตรวจจับการทุจริต อย่างไรก็ตาม ข้อมูลการทุจริตมักมีขนาดใหญ่มาก โดยเฉพาะเมื่อทำงานกับข้อมูลธุรกรรม MiniBatch K-means เป็นวิธีที่ มีประสิทธิภาพ ในการรัน K-means บนชุดข้อมูลขนาดใหญ่ ซึ่งจะได้นำมาใช้ในแบบฝึกหัดนี้
ข้อมูลที่ผ่านการ scaling จากแบบฝึกหัดก่อนหน้า X_scaled พร้อมใช้งานแล้ว มาลองทำกันเลย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การตรวจจับการฉ้อโกงด้วย Python
คำแนะนำการฝึกหัด
- นำเข้า
MiniBatchKMeansจากsklearn - กำหนดค่าเริ่มต้นให้โมเดล MiniBatch K-means ด้วย 8 คลัสเตอร์
- ฟิตโมเดลกับข้อมูลที่ผ่านการ scaling แล้ว
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import MiniBatchKmeans
from sklearn.cluster import ____
# Define the model
kmeans = ____(n_clusters=____, random_state=0)
# Fit the model to the scaled data
kmeans.____(____)