開始使用免費開始

綜合應用:以文字為基礎的樹狀圖

是時候動手做出你的第一個文字型樹狀圖了。記住,樹狀圖會壓縮資訊,幫助你理解資料。這有點像平均數能告訴你族群的一些情況,但不是全部。兩者都有可能誤導。處理文字時,常會出現許多沒有意義的群集,不過也可能出現一些有價值的群集。

TDM 和 DTM 物件有個特殊之處:在搭配 dist() 函式使用之前,必須先用 as.matrix() 轉換為矩陣。

在關於 chardonnay 的推文中,你也許會驚訝地在文字雲看到靈魂音樂傳奇 Marvin Gaye。來看看樹狀圖是否也會捕捉到同樣的現象。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

  • removeSparseTerms() 套用在 tweets_tdm 上建立 tweets_tdm2。請使用 sparse = 0.975
  • 使用 as.matrix()tweets_tdm2 轉為矩陣形式,建立 tdm_m
  • 使用 dist() 計算 tdm_m 的距離,建立 tweets_dist
  • tweets_dist 使用 hclust() 建立階層式分群物件 hc
  • 使用 plot()hc 繪製樹狀圖。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create tweets_tdm2
___ <- ___(___, ___)

# Create tdm_m
___ <- ___(___)

# Create tweets_dist
___ <- ___(___)

# Create hc
___ <- ___(___)

# Plot the dendrogram
___(___)
編輯並執行程式碼