清理與計數
移除停用字,僅探索 twitter_data 中被分類為申訴的航空公司推文內容。
本練習屬於課程
R 文字分析入門
練習說明
- 對
twitter_data的推文進行斷詞,將斷詞後的欄位命名為word。 - 從斷詞後的
twitter_data中移除預設的停用字。 - 篩選只保留申訴。
- 以斷詞且清理後的文字計算字詞出現次數,並依計數由高到低排序。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)