始める無料で始める

著者の労力を評価する

著者は、より情熱的なときに言葉数が増えることがあります。たとえば、腹を立てた航空会社の乗客は、(自分の感じた)サービスが悪いほど長いレビューを残しがちです。反対に、熱量の低い乗客は、時間をかけてレビューを書く必要性をあまり感じないかもしれません。レビューが長くなるほど、ポジティブまたはネガティブな表現が必然的に増えるため、全体のセンチメントが膨らんで見える可能性があります。このコーディング演習では、労力とセンチメントを検討します。

この演習では、労力とセンチメントの関係を可視化します。レンタル物件のレビューを格納した tibble には id があり、各行が1語を表していることを思い出してください。つまり、id に対してシンプルに count() を行えば、各レビューで使われた単語数を取得できます。次に、この集計結果をポジティブ・ネガティブのデータに結合します。最終的に、レビューの長さと極性の関係を可視化する散布図を作成します。

この演習はコースの一部です

Rで学ぶSentiment Analysis

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Review tidy_reviews and pos_neg
tidy_reviews
pos_neg

pos_neg_pol <- tidy_reviews %>% 
  # Effort is measured as count by id
  ___(___) %>% 
  # Inner join to pos_neg
  ___(___) %>% 
  # Add polarity status
  ___(pol = ___(___, "___", "___"))

# Examine results
pos_neg_pol
コードを編集して実行