綜合應用:以文字為基礎的樹狀圖
是時候動手做出你的第一個文字型樹狀圖了。記住,樹狀圖會壓縮資訊,幫助你理解資料。這有點像平均數能告訴你族群的一些情況,但不是全部。兩者都有可能誤導。處理文字時,常會出現許多沒有意義的群集,不過也可能出現一些有價值的群集。
TDM 和 DTM 物件有個特殊之處:在搭配 dist() 函式使用之前,必須先用 as.matrix() 轉換為矩陣。
在關於 chardonnay 的推文中,你也許會驚訝地在文字雲看到靈魂音樂傳奇 Marvin Gaye。來看看樹狀圖是否也會捕捉到同樣的現象。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
- 以
removeSparseTerms()套用在tweets_tdm上建立tweets_tdm2。請使用sparse = 0.975。 - 使用
as.matrix()將tweets_tdm2轉為矩陣形式,建立tdm_m。 - 使用
dist()計算tdm_m的距離,建立tweets_dist。 - 對
tweets_dist使用hclust()建立階層式分群物件hc。 - 使用
plot()與hc繪製樹狀圖。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create tweets_tdm2
___ <- ___(___, ___)
# Create tdm_m
___ <- ___(___)
# Create tweets_dist
___ <- ___(___)
# Create hc
___ <- ___(___)
# Plot the dendrogram
___(___)