開始使用免費開始

清理與計數

移除停用字,僅探索 twitter_data 中被分類為申訴的航空公司推文內容。

本練習屬於課程

R 文字分析入門

檢視課程

練習說明

  • twitter_data 的推文進行斷詞,將斷詞後的欄位命名為 word
  • 從斷詞後的 twitter_data 中移除預設的停用字。
  • 篩選只保留申訴。
  • 以斷詞且清理後的文字計算字詞出現次數,並依計數由高到低排序。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
編輯並執行程式碼