开始使用免费开始使用

使用 qdap 获取高频词

如果您不介意放弃对具体预处理步骤的一些控制,那么使用 qdap 包中的 freq_terms() 可以快速获取高频词。

该函数接收一个文本变量,在这里就是 tweets$text 向量。您可以通过 top 参数指定显示的最高词条数量,通过 stopwords 参数传入要移除的停用词向量,并用 at.least 参数设定需纳入统计的单词最小字符长度。qdap 有自己的停用词列表,与 tm 中的不同。本练习将向您展示如何使用这两种停用词并比较它们的结果。

对结果进行基础绘图很简单。只需对 freq_terms() 的返回对象调用 plot() 即可。

本练习是课程的一部分

使用 R 的 Bag-of-Words 进行文本挖掘

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create frequency
frequency <- ___(
  ___, 
  top = ___, 
  at.least = ___, 
  stopwords = ___
)

# Make a frequency bar chart
编辑并运行代码