НачатьНачать бесплатно

Кластеризация K-means

Один из наиболее широко применяемых алгоритмов кластеризации — K-means. Для обнаружения мошенничества он прост в реализации и достаточно эффективен при выявлении подозрительных случаев. Это хорошая отправная точка при решении задач fraud-детекции. Однако данные о мошенничестве нередко бывают очень большими — особенно когда речь идёт о транзакционных данных. MiniBatch K-means — это эффективный способ применить K-means к большому набору данных, и именно его вы будете использовать в этом упражнении.

Масштабированные данные из предыдущего упражнения, X_scaled, уже доступны. Давайте попробуем!

Это упражнение является частью курса

Обнаружение мошенничества на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте MiniBatchKMeans из sklearn.
  • Инициализируйте модель MiniBatch K-means с 8 кластерами.
  • Обучите модель на масштабированных данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import MiniBatchKmeans 
from sklearn.cluster import ____

# Define the model 
kmeans = ____(n_clusters=____, random_state=0)

# Fit the model to the scaled data
kmeans.____(____)
Редактировать и запускать код