开始使用免费开始使用

特征提取与分析:amzn_pros

amzn_pros_corpamzn_cons_corpgoog_pros_corpgoog_cons_corp 都已完成预处理,现在您可以提取想要分析的特征。由于您采用的是 bag of words 方法,您决定为 Amazon 的正面评价语料 amzn_pros_corp 创建一个二元词组的 TermDocumentMatrix。基于此,您可以快速创建一个 wordcloud(),以了解大家对在 Amazon 工作所持的正面联想短语。

下方函数使用 RWeka 将文本分词为二元词组,并在本练习中于后台调用。

tokenizer <- function(x) {
  NGramTokenizer(x, Weka_control(min = 2, max = 2))
}

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

练习说明

  • 使用 amzn_pros_corp 创建 TermDocumentMatrix,命名为 amzn_p_tdm。请确保添加 control = list(tokenize = tokenizer),以便术语为二元词组。
  • 使用 as.matrix()amzn_p_tdm 转为矩阵,创建 amzn_p_tdm_m
  • amzn_p_tdm_m 中提取术语频数,创建 amzn_p_freq
  • 使用 wordcloud() 绘制词云:以 names(amzn_p_freq) 作为词,以 amzn_p_freq 作为频数,并设置 max.words = 25color = "blue" 以美化显示。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_tdm_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Plot a word cloud using amzn_p_freq values
___(___)
编辑并运行代码