特征提取与分析:amzn_pros
amzn_pros_corp、amzn_cons_corp、goog_pros_corp 和 goog_cons_corp 都已完成预处理,现在您可以提取想要分析的特征。由于您采用的是 bag of words 方法,您决定为 Amazon 的正面评价语料 amzn_pros_corp 创建一个二元词组的 TermDocumentMatrix。基于此,您可以快速创建一个 wordcloud(),以了解大家对在 Amazon 工作所持的正面联想短语。
下方函数使用 RWeka 将文本分词为二元词组,并在本练习中于后台调用。
tokenizer <- function(x) {
NGramTokenizer(x, Weka_control(min = 2, max = 2))
}
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 使用
amzn_pros_corp创建TermDocumentMatrix,命名为amzn_p_tdm。请确保添加control = list(tokenize = tokenizer),以便术语为二元词组。 - 使用
as.matrix()将amzn_p_tdm转为矩阵,创建amzn_p_tdm_m。 - 从
amzn_p_tdm_m中提取术语频数,创建amzn_p_freq。 - 使用
wordcloud()绘制词云:以names(amzn_p_freq)作为词,以amzn_p_freq作为频数,并设置max.words = 25与color = "blue"以美化显示。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_tdm_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Plot a word cloud using amzn_p_freq values
___(___)