開始使用免費開始

距離矩陣與樹狀圖

做詞彙叢集分析的一個簡單方法,是在你的 term-document matrix(TDM,詞彙—文件矩陣)上繪製樹狀圖。當你有了 TDM 之後,就可以呼叫 dist() 計算矩陣每一列之間的差異。

接著,呼叫 hclust(),在距離矩陣的不相似度上進行叢集分析。最後,你可以用樹狀圖與 plot() 視覺化詞頻之間的距離。在文字探勘中,常能藉由樹狀圖發掘有趣的洞見或詞彙叢集。

想想你在上一支影片看到的年度降雨量表。Cleveland 與 Portland 的降雨量相同,因此它們的距離為 0。你可能會預期這兩個城市會聚成一群,而 New Orleans 因為降雨量高出許多,會獨立成一群。

       city rainfall
  Cleveland    39.14
   Portland    39.14
     Boston    43.77
New Orleans    62.45

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

資料框 rain 已預先載入你的工作環境。

  • 使用 dist() 作用在 rain 的第 2 欄數值上,建立 dist_rain
  • 在主控台列印 dist_rain 矩陣。
  • 使用 hclust() 作用在 dist_rain 上進行叢集分析,建立 hc
  • plot() 繪製物件 hc,並使用 labels = rain$city 加上城市名稱。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create dist_rain
___ <- ___(___)

# View the distance matrix
___

# Create hc
___ <- ___(___)

# Plot hc
___(___, ___)
編輯並執行程式碼