使用 qdap 获取高频词
如果您不介意放弃对具体预处理步骤的一些控制,那么使用 qdap 包中的 freq_terms() 可以快速获取高频词。
该函数接收一个文本变量,在这里就是 tweets$text 向量。您可以通过 top 参数指定显示的最高词条数量,通过 stopwords 参数传入要移除的停用词向量,并用 at.least 参数设定需纳入统计的单词最小字符长度。qdap 有自己的停用词列表,与 tm 中的不同。本练习将向您展示如何使用这两种停用词并比较它们的结果。
对结果进行基础绘图很简单。只需对 freq_terms() 的返回对象调用 plot() 即可。
本练习是课程的一部分
使用 R 的 Bag-of-Words 进行文本挖掘
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create frequency
frequency <- ___(
___,
top = ___,
at.least = ___,
stopwords = ___
)
# Make a frequency bar chart