始める無料で始める

グループ化した要約

twitter_data では、苦情ではないツイートのほうが苦情ツイートより多いようです。本当にTwitterのデータなのか、少し疑問に感じ始めたかもしれません。ツイート本文に入る前に、twitter_data には他にも調べておくとよい列があります。各ツイートには、そのユーザーのフォロワー数が usr_followers_count 列に含まれています。苦情を投稿する人は、平均して苦情を投稿しない人よりフォロワーが多いと思いますか?それとも少ないと思いますか?グループ化した要約を使えば、手早くその答えを確認できます。

この演習はコースの一部です

Rで始めるテキスト分析

コースを見る

演習の手順

  • complaint_label でデータをグループ化します。
  • usr_followers_count の平均、最小、最大を計算します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Start with the data frame
___ %>% 
  # Group the data by whether or not the tweet is a complaint
  ___(___) %>% 
  # Compute the mean, min, and max follower counts
  summarize(
    avg_followers = ___(___),
    min_followers = ___(___),
    max_followers = ___(___)
  )
コードを編集して実行