开始使用免费开始使用

清洗与计数

移除停用词,以探索 twitter_data 中被分类为投诉的航空公司推文的内容。

本练习是课程的一部分

R 文本分析入门

查看课程

练习说明

  • twitter_data 中的推文进行分词。将分词后的单词列命名为 word
  • 从分词后的 twitter_data 中移除默认停用词。
  • 过滤,仅保留投诉类推文。
  • 使用分词且清洗后的文本计算词频,并按计数降序排序。

交互式实操练习

通过完成这段示例代码来试试这个练习。

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
编辑并运行代码