始める無料で始める

クリーニングとカウント

twitter_data のうち、苦情と分類された航空会社のツイートだけを対象に、ストップワードを除去して内容を確認します。

この演習はコースの一部です

Rで始めるテキスト分析

コースを見る

演習の手順

  • twitter_data のツイートをトークン化し、トークン化した単語の列名を word にします。
  • トークン化した twitter_data からデフォルトのストップワードを除去します。
  • 苦情だけが残るようにフィルタします。
  • トークン化・クリーニング後のテキストで単語数を集計し、件数の降順で並べ替えます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
コードを編集して実行