開始使用免費開始

詞彙關聯

如預期,你在樹狀圖中看到相似主題。切回正向評論後,你決定檢視在文字雲中出現的熱門片語。你希望用 tmfindAssocs() 函式找出相關詞彙。既然已經知道工時很長、缺乏工作與生活平衡,這次你想檢查是否有令人意外的發現。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

amzn_pros_corp 語料庫已用自訂函式清理過,和先前一樣。

  • amzn_pros_corpcontrol = list(tokenize = tokenizer) 建立名為 amzn_p_tdm 的 TDM。
  • amzn_p_tdm 轉成矩陣,建立 amzn_p_m
  • amzn_p_m 套用 rowSums(),建立 amzn_p_freq
  • 使用 sort() 搭配參數 decreasing = TRUE 作用在 amzn_p_freq 上,建立 term_frequency
  • 使用 term_frequency[1:5] 檢視前 5 個雙詞片語。
  • 當「fast paced」成為熱門詞時,你可能會感到意外,因為它可能與「long hours」相關而帶有負面意涵。查看與「fast paced」最相關的詞。對 amzn_p_tdm 使用 findAssocs(),以 "fast paced" 為查詢、門檻為 0.2

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Create term_frequency
___ <- ___

# Print the 5 most common terms
___

# Find associations with fast-paced
___
編輯並執行程式碼