特征提取与分析:amzn_cons
现在,您决定用另一个二元词组 TDM 来对比 amzn_cons_corp 语料库。您当然期望在词云中看到一些不同的短语。
您仍将使用这个自定义函数为可视化提取二元词组特征:
tokenizer <- function(x)
NGramTokenizer(x, Weka_control(min = 2, max = 2))
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 通过把
amzn_cons_corp转换为TermDocumentMatrix并加入二元词组函数control = list(tokenize = tokenizer),创建amzn_c_tdm。 - 将
amzn_c_tdm转换为矩阵,创建amzn_c_tdm_m。 - 使用
rowSums()从amzn_c_tdm_m中获取词项频率,创建amzn_c_freq。 - 使用
names(amzn_c_freq)和取值amzn_c_freq调用wordcloud()创建词云。同时使用参数max.words = 25和color = "red"。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Create amzn_c_tdm_m
___ <- ___
# Create amzn_c_freq
___ <- ___
# Plot a word cloud of negative Amazon bigrams
___