クリーニングとカウント
twitter_data のうち、苦情と分類された航空会社のツイートだけを対象に、ストップワードを除去して内容を確認します。
この演習はコースの一部です
Rで始めるテキスト分析
演習の手順
twitter_dataのツイートをトークン化し、トークン化した単語の列名をwordにします。- トークン化した
twitter_dataからデフォルトのストップワードを除去します。 - 苦情だけが残るようにフィルタします。
- トークン化・クリーニング後のテキストで単語数を集計し、件数の降順で並べ替えます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)