階層式凝聚分群(Hierarchical Agglomerative Clustering)
在上一個練習中,你看到在執行 K-means 分群時,群數會影響結果,這能幫助你在機器學習面試中討論 K-means。不過,你也可以使用另一種分群模型:階層式凝聚分群。在 Python 中,你可以用視覺化與數學方式推導出此技術的最佳群數。你會使用 scipy 和 sklearn 模組來完成這兩種方法。
回想一下,從樹狀圖(dendrogram)選擇最佳群數,會同時取決於連結準則(linkage criteria)與距離門檻(distance threshold)。在這裡,你將使用 diabetes 的 X 矩陣建立一個樹狀圖,然後在長度 1.50 的位置畫出一條假想的水平線,計算它穿過的垂直線條數,作為接下來階層式分群演算法的最佳群數。
本練習屬於課程
用 Python 練習機器學習面試題
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import hierarchical clustering libraries
import ____.____.____ as sch
from ____.____ import ____