清洗与计数
移除停用词,以探索 twitter_data 中被分类为投诉的航空公司推文的内容。
本练习是课程的一部分
R 文本分析入门
练习说明
- 对
twitter_data中的推文进行分词。将分词后的单词列命名为word。 - 从分词后的
twitter_data中移除默认停用词。 - 过滤,仅保留投诉类推文。
- 使用分词且清洗后的文本计算词频,并按计数降序排序。
交互式实操练习
通过完成这段示例代码来试试这个练习。
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)