センチメントと感情
sentiments データセット内の nrc レキシコンには、単語とその単語に結び付けられた感情の辞書が含まれています。joy、trust、anticipation などの感情がこのデータセットに含まれています。
これまでに見てきたロシアのツイートボットのデータセットでは、リベラル寄りと保守寄りの両方のボットが発信したツイートを確認しました。nrc レキシコンを使って、リベラル寄り(民主系)のツイートボットが送信したツイートの内容を調べましょう。左派ツイートである left は単語にトークン化され、ストップワードは削除済みです。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
nrcレキシコンから anticipation の単語だけで構成された tibble を作成します。nrcレキシコンから joy の単語だけで構成された tibble を作成します。left_tokensで見つかった上位のanticipationの単語を表示します。left_tokensで見つかった上位のjoyの単語を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
left_tokens <- left %>%
unnest_tokens(output = "word", token = "words", input = content) %>%
anti_join(stop_words)
# Dictionaries
anticipation <- ___("nrc") %>%
___(sentiment == "anticipation")
joy <- ___("nrc") %>%
___(sentiment == "joy")
# Print top words for Anticipation and Joy
left_tokens %>%
___(anticipation, by = "word") %>%
___(word, sort = TRUE)
left_tokens %>%
___(joy, by = "word") %>%
___(word, sort = TRUE)