amzn_cons 階層式分群樹狀圖
從評論看來,加班時數多、工作與生活失衡的跡象相當明顯。你決定用一個簡單的分群方法——階層式分群,並畫出樹狀圖,來觀察這些片語之間的關聯程度。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
- 使用
amzn_cons_corp建立amzn_c_tdm,型別為TermDocumentMatrix,並設定control = list(tokenize = tokenizer)。 - 在主控台列印
amzn_c_tdm。 - 以
removeSparseTerms()套用在amzn_c_tdm上,將sparse參數設為.993,建立amzn_c_tdm2。 - 建立階層式分群物件
hc:把距離矩陣dist(amzn_c_tdm2)巢狀傳入hclust(),並同時傳入method = "complete"。 - 繪製
hc,檢視分群後的雙詞詞組(bigrams),看看 Amazon 缺點區段中的概念如何引導你做出結論。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Print amzn_c_tdm to the console
___
# Create amzn_c_tdm2 by removing sparse terms
___ <- ___
# Create hc as a cluster of distance values
___ <- ___(___,
___)
# Produce a plot of hc
___