词语关联
正如预期,您在树状图中看到了类似的话题。切回正面评论后,您决定检查词云中出现的高频短语。您希望使用 tm 中的 findAssocs() 函数找到相关术语。鉴于您已经了解到加班多、缺乏工作与生活平衡,现在想看看是否有出人意料的发现。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
amzn_pros_corp 语料库已像之前一样用自定义函数完成清洗。
- 从
amzn_pros_corp构建名为amzn_p_tdm的 TDM,并使用control = list(tokenize = tokenizer)。 - 将
amzn_p_tdm转换为矩阵,创建amzn_p_m。 - 对
amzn_p_m应用rowSums(),创建amzn_p_freq。 - 使用
sort()作用于amzn_p_freq并设置参数decreasing = TRUE,创建term_frequency。 - 使用
term_frequency[1:5]查看前 5 个二元词组。 - 您可能会惊讶地发现 "fast paced" 位居高频词之列,因为它可能与 "long hours" 相关而带有负面含义。查看与 "fast paced" 关联度最高的词。对
amzn_p_tdm使用findAssocs()来检索"fast paced",并设置阈值为0.2。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Create term_frequency
___ <- ___
# Print the 5 most common terms
___
# Find associations with fast-paced
___