詞彙關聯
如預期,你在樹狀圖中看到相似主題。切回正向評論後,你決定檢視在文字雲中出現的熱門片語。你希望用 tm 的 findAssocs() 函式找出相關詞彙。既然已經知道工時很長、缺乏工作與生活平衡,這次你想檢查是否有令人意外的發現。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
amzn_pros_corp 語料庫已用自訂函式清理過,和先前一樣。
- 以
amzn_pros_corp與control = list(tokenize = tokenizer)建立名為amzn_p_tdm的 TDM。 - 將
amzn_p_tdm轉成矩陣,建立amzn_p_m。 - 對
amzn_p_m套用rowSums(),建立amzn_p_freq。 - 使用
sort()搭配參數decreasing = TRUE作用在amzn_p_freq上,建立term_frequency。 - 使用
term_frequency[1:5]檢視前 5 個雙詞片語。 - 當「fast paced」成為熱門詞時,你可能會感到意外,因為它可能與「long hours」相關而帶有負面意涵。查看與「fast paced」最相關的詞。對
amzn_p_tdm使用findAssocs(),以"fast paced"為查詢、門檻為0.2。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Create term_frequency
___ <- ___
# Print the 5 most common terms
___
# Find associations with fast-paced
___