停用词与词云
现在您已经进入文本挖掘的思维模式,端起一杯可口的 chardonnay,我们需要更进一步。上一个词云中,"chardonnay" 一枝独秀,强到让其他有趣的信息都难以显现。
让我们把 "chardonnay" 加入停用词,看看还有哪些常见词此前被淹没了。
工作区中有清洗后的 chardonnay 推文。接下来我们要移除一些无信息量的词。本练习会用 content() 展示一条特定推文以便对比。请记住,用双方括号为语料库列表建立索引。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
练习说明
- 对
chardonnay_corp中第 24 个文档应用content()。 - 将
"chardonnay"追加到英文停用词中,并赋值给stops。 - 查看
stops的最后 6 个词。 - 使用
tm_map()创建cleaned_chardonnay_corp:依次传入chardonnay_corp、函数removeWords(),最后传入停用词stops。 - 现在再次查看第
24条推文的content,对比结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Review a "cleaned" tweet
___(___)
# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')
# Review last 6 stopwords
tail(stops)
# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)
# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])