Ієрархічне агломеративне кластеризування
У попередній вправі ви побачили, як кількість кластерів під час виконання кластеризації K-means може вплинути на результат, що дає змогу обговорювати K-means на співбесіді з машинного навчання. Однак ви можете використати й іншу модель кластеризації — ієрархічне агломеративне кластеризування. У Python можна визначити оптимальну кількість кластерів для цього підходу як візуально, так і математично. Ви використаєте модулі scipy та sklearn для обох підходів.
Згадайте, що вибір оптимальної кількості кластерів за дендрограмою залежить і від критерію зв'язування (linkage), і від порогу відстані. Тут ви створите дендрограму на основі матриці X з diabetes, а потім проведете уявну горизонтальну лінію на рівні 1,50, порахувавши кількість вертикальних відрізків, які вона перетинає. Це і буде оптимальна кількість кластерів для вашого алгоритму ієрархічного кластеризування надалі.
Ця вправа є частиною курсу
Практика співбесід з Machine Learning у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import hierarchical clustering libraries
import ____.____.____ as sch
from ____.____ import ____