НачатьНачать бесплатно

Иерархическая агломеративная кластеризация

В предыдущем упражнении вы увидели, как выбор числа кластеров при K-means кластеризации влияет на результаты, что позволяет уверенно обсуждать этот метод на собеседовании по машинному обучению. Однако существует и другой алгоритм кластеризации — иерархическая агломеративная кластеризация. В Python можно определить оптимальное число кластеров для этого метода как визуально, так и математически. Для этого вы воспользуетесь модулями scipy и sklearn.

Напомним, что выбор оптимального числа кластеров по дендрограмме зависит от критерия слияния и порогового расстояния. Здесь вы построите дендрограмму на основе матрицы X из набора данных diabetes, затем проведёте воображаемую линию на уровне 1,50 и подсчитаете количество пересечённых вертикальных линий — это и будет оптимальное число кластеров для вашего алгоритма иерархической кластеризации.

Это упражнение является частью курса

Практика вопросов интервью по машинному обучению на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import hierarchical clustering libraries
import ____.____.____ as sch
from ____.____ import ____
Редактировать и запускать код