データ準備
2016年の米国選挙では、ロシアのツイートボットが民主党・共和党の双方に向けて政治的レトリックを継続的に拡散していました。こうしたツイートのデータセット russian_tweets が与えられています。これらのツイートを、左派(民主党)か右派(共和党)かで分類することにしました。分類モデルを構築する前に、モデリングのためにテキストをクリーンアップして準備する必要があります。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
- トークンのステミングを行い、トークン化処理を仕上げます。
cast_dtm()を使ってドキュメント-単語行列を作成します。- ドキュメント-単語行列にtfidfの重み付けを適用します。
- 行列を出力(印刷)します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Stem the tokens
russian_tokens <- russian_tweets %>%
unnest_tokens(output = "word", token = "words", input = content) %>%
anti_join(stop_words) %>%
___(word = ___(word))
# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
count(tweet_id, word) %>%
___(document = ___, term = ___,
value = n, weighting = tm::___)
# Print the matrix details
___