始める無料で始める

センチメントと感情

sentiments データセット内の nrc レキシコンには、単語とその単語に結び付けられた感情の辞書が含まれています。joy、trust、anticipation などの感情がこのデータセットに含まれています。

これまでに見てきたロシアのツイートボットのデータセットでは、リベラル寄りと保守寄りの両方のボットが発信したツイートを確認しました。nrc レキシコンを使って、リベラル寄り(民主系)のツイートボットが送信したツイートの内容を調べましょう。左派ツイートである left は単語にトークン化され、ストップワードは削除済みです。

この演習はコースの一部です

Rで学ぶ自然言語処理入門

コースを見る

演習の手順

  • nrc レキシコンから anticipation の単語だけで構成された tibble を作成します。
  • nrc レキシコンから joy の単語だけで構成された tibble を作成します。
  • left_tokens で見つかった上位の anticipation の単語を表示します。
  • left_tokens で見つかった上位の joy の単語を表示します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

left_tokens <- left %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words)
# Dictionaries 
anticipation <- ___("nrc") %>% 
  ___(sentiment == "anticipation")
joy <- ___("nrc") %>% 
  ___(sentiment == "joy")
# Print top words for Anticipation and Joy
left_tokens %>%
  ___(anticipation, by = "word") %>%
  ___(word, sort = TRUE)
left_tokens %>%
  ___(joy, by = "word") %>%
  ___(word, sort = TRUE)
コードを編集して実行