开始使用免费开始使用

词语关联

正如预期,您在树状图中看到了类似的话题。切回正面评论后,您决定检查词云中出现的高频短语。您希望使用 tm 中的 findAssocs() 函数找到相关术语。鉴于您已经了解到加班多、缺乏工作与生活平衡,现在想看看是否有出人意料的发现。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

amzn_pros_corp 语料库已像之前一样用自定义函数完成清洗。

  • amzn_pros_corp 构建名为 amzn_p_tdm 的 TDM,并使用 control = list(tokenize = tokenizer)
  • amzn_p_tdm 转换为矩阵,创建 amzn_p_m
  • amzn_p_m 应用 rowSums(),创建 amzn_p_freq
  • 使用 sort() 作用于 amzn_p_freq 并设置参数 decreasing = TRUE,创建 term_frequency
  • 使用 term_frequency[1:5] 查看前 5 个二元词组。
  • 您可能会惊讶地发现 "fast paced" 位居高频词之列,因为它可能与 "long hours" 相关而带有负面含义。查看与 "fast paced" 关联度最高的词。对 amzn_p_tdm 使用 findAssocs() 来检索 "fast paced",并设置阈值为 0.2

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Create term_frequency
___ <- ___

# Print the 5 most common terms
___

# Find associations with fast-paced
___
编辑并运行代码