Bắt đầu ngayBắt đầu miễn phí

Phân cụm K-means

Một thuật toán phân cụm được dùng rất phổ biến là K-means clustering. Với phát hiện gian lận, K-means dễ triển khai và khá hiệu quả trong việc dự đoán các trường hợp đáng ngờ. Đây là thuật toán tốt để bắt đầu khi xử lý các bài toán phát hiện gian lận. Tuy nhiên, dữ liệu gian lận thường rất lớn, đặc biệt khi bạn làm việc với dữ liệu giao dịch. MiniBatch K-means là cách hiệu quả để triển khai K-means trên tập dữ liệu lớn, và bạn sẽ dùng cách này trong bài tập này.

Dữ liệu đã được scale từ bài trước, X_scaled, đã sẵn sàng. Hãy thử áp dụng nhé.

Bài tập này là một phần của khóa học

Phát hiện gian lận với Python

Xem khóa học

Hướng dẫn bài tập

  • Import MiniBatchKMeans từ sklearn.
  • Khởi tạo mô hình minibatch kmeans với 8 cụm.
  • Fit mô hình với dữ liệu đã scale của bạn.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import MiniBatchKmeans 
from sklearn.cluster import ____

# Define the model 
kmeans = ____(n_clusters=____, random_state=0)

# Fit the model to the scaled data
kmeans.____(____)
Chỉnh sửa và Chạy Mã