開始使用免費開始

amzn_cons 階層式分群樹狀圖

從評論看來,加班時數多、工作與生活失衡的跡象相當明顯。你決定用一個簡單的分群方法——階層式分群,並畫出樹狀圖,來觀察這些片語之間的關聯程度。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

  • 使用 amzn_cons_corp 建立 amzn_c_tdm,型別為 TermDocumentMatrix,並設定 control = list(tokenize = tokenizer)
  • 在主控台列印 amzn_c_tdm
  • removeSparseTerms() 套用在 amzn_c_tdm 上,將 sparse 參數設為 .993,建立 amzn_c_tdm2
  • 建立階層式分群物件 hc:把距離矩陣 dist(amzn_c_tdm2) 巢狀傳入 hclust(),並同時傳入 method = "complete"
  • 繪製 hc,檢視分群後的雙詞詞組(bigrams),看看 Amazon 缺點區段中的概念如何引導你做出結論。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Print amzn_c_tdm to the console
___

# Create amzn_c_tdm2 by removing sparse terms 
___ <- ___

# Create hc as a cluster of distance values
___ <- ___(___,
           ___)

# Produce a plot of hc
___
編輯並執行程式碼