开始使用免费开始使用

特征提取与分析:amzn_cons

现在,您决定用另一个二元词组 TDM 来对比 amzn_cons_corp 语料库。您当然期望在词云中看到一些不同的短语。

您仍将使用这个自定义函数为可视化提取二元词组特征:

tokenizer <- function(x) 
  NGramTokenizer(x, Weka_control(min = 2, max = 2))

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • 通过把 amzn_cons_corp 转换为 TermDocumentMatrix 并加入二元词组函数 control = list(tokenize = tokenizer),创建 amzn_c_tdm
  • amzn_c_tdm 转换为矩阵,创建 amzn_c_tdm_m
  • 使用 rowSums()amzn_c_tdm_m 中获取词项频率,创建 amzn_c_freq
  • 使用 names(amzn_c_freq) 和取值 amzn_c_freq 调用 wordcloud() 创建词云。同时使用参数 max.words = 25color = "red"

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_c_tdm_m
___ <- ___

# Create amzn_c_freq
___ <- ___

# Plot a word cloud of negative Amazon bigrams
___
编辑并运行代码