距離矩陣與樹狀圖
做詞彙叢集分析的一個簡單方法,是在你的 term-document matrix(TDM,詞彙—文件矩陣)上繪製樹狀圖。當你有了 TDM 之後,就可以呼叫 dist() 計算矩陣每一列之間的差異。
接著,呼叫 hclust(),在距離矩陣的不相似度上進行叢集分析。最後,你可以用樹狀圖與 plot() 視覺化詞頻之間的距離。在文字探勘中,常能藉由樹狀圖發掘有趣的洞見或詞彙叢集。
想想你在上一支影片看到的年度降雨量表。Cleveland 與 Portland 的降雨量相同,因此它們的距離為 0。你可能會預期這兩個城市會聚成一群,而 New Orleans 因為降雨量高出許多,會獨立成一群。
city rainfall
Cleveland 39.14
Portland 39.14
Boston 43.77
New Orleans 62.45
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
資料框 rain 已預先載入你的工作環境。
- 使用
dist()作用在rain的第 2 欄數值上,建立dist_rain。 - 在主控台列印
dist_rain矩陣。 - 使用
hclust()作用在dist_rain上進行叢集分析,建立hc。 - 以
plot()繪製物件hc,並使用labels = rain$city加上城市名稱。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create dist_rain
___ <- ___(___)
# View the distance matrix
___
# Create hc
___ <- ___(___)
# Plot hc
___(___, ___)