グループ化した要約
twitter_data では、苦情ではないツイートのほうが苦情ツイートより多いようです。本当にTwitterのデータなのか、少し疑問に感じ始めたかもしれません。ツイート本文に入る前に、twitter_data には他にも調べておくとよい列があります。各ツイートには、そのユーザーのフォロワー数が usr_followers_count 列に含まれています。苦情を投稿する人は、平均して苦情を投稿しない人よりフォロワーが多いと思いますか?それとも少ないと思いますか?グループ化した要約を使えば、手早くその答えを確認できます。
この演習はコースの一部です
Rで始めるテキスト分析
演習の手順
complaint_labelでデータをグループ化します。usr_followers_countの平均、最小、最大を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Start with the data frame
___ %>%
# Group the data by whether or not the tweet is a complaint
___(___) %>%
# Compute the mean, min, and max follower counts
summarize(
avg_followers = ___(___),
min_followers = ___(___),
max_followers = ___(___)
)