Phân cụm K-means
Một thuật toán phân cụm được dùng rất phổ biến là K-means clustering. Với phát hiện gian lận, K-means dễ triển khai và khá hiệu quả trong việc dự đoán các trường hợp đáng ngờ. Đây là thuật toán tốt để bắt đầu khi xử lý các bài toán phát hiện gian lận. Tuy nhiên, dữ liệu gian lận thường rất lớn, đặc biệt khi bạn làm việc với dữ liệu giao dịch. MiniBatch K-means là cách hiệu quả để triển khai K-means trên tập dữ liệu lớn, và bạn sẽ dùng cách này trong bài tập này.
Dữ liệu đã được scale từ bài trước, X_scaled, đã sẵn sàng. Hãy thử áp dụng nhé.
Bài tập này là một phần của khóa học
Phát hiện gian lận với Python
Hướng dẫn bài tập
- Import
MiniBatchKMeanstừsklearn. - Khởi tạo mô hình minibatch kmeans với 8 cụm.
- Fit mô hình với dữ liệu đã scale của bạn.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import MiniBatchKmeans
from sklearn.cluster import ____
# Define the model
kmeans = ____(n_clusters=____, random_state=0)
# Fit the model to the scaled data
kmeans.____(____)