Кластеризация K-means
Один из наиболее широко применяемых алгоритмов кластеризации — K-means. Для обнаружения мошенничества он прост в реализации и достаточно эффективен при выявлении подозрительных случаев. Это хорошая отправная точка при решении задач fraud-детекции. Однако данные о мошенничестве нередко бывают очень большими — особенно когда речь идёт о транзакционных данных. MiniBatch K-means — это эффективный способ применить K-means к большому набору данных, и именно его вы будете использовать в этом упражнении.
Масштабированные данные из предыдущего упражнения, X_scaled, уже доступны. Давайте попробуем!
Это упражнение является частью курса
Обнаружение мошенничества на Python
Инструкции к упражнению
- Импортируйте
MiniBatchKMeansизsklearn. - Инициализируйте модель MiniBatch K-means с 8 кластерами.
- Обучите модель на масштабированных данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import MiniBatchKmeans
from sklearn.cluster import ____
# Define the model
kmeans = ____(n_clusters=____, random_state=0)
# Fit the model to the scaled data
kmeans.____(____)