Сгруппированные сводки
Итак, в twitter_data записей без жалоб больше, чем записей с жалобами. Возможно, вы уже начинаете сомневаться, действительно ли эти данные взяты из Twitter! Перед тем как перейти непосредственно к текстам твитов, стоит изучить ещё несколько интересных столбцов в twitter_data. Каждый твит содержит информацию о количестве подписчиков пользователя в столбце usr_followers_count. Как вы думаете: у тех, кто пишет жалобы, в среднем больше или меньше подписчиков, чем у остальных? Сгруппированные сводки помогут быстро найти ответ.
Это упражнение является частью курса
Введение в анализ текста на R
Инструкции к упражнению
- Сгруппируйте данные по столбцу
complaint_label. - Вычислите среднее, минимальное и максимальное значения столбца
usr_followers_count.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Start with the data frame
___ %>%
# Group the data by whether or not the tweet is a complaint
___(___) %>%
# Compute the mean, min, and max follower counts
summarize(
avg_followers = ___(___),
min_followers = ___(___),
max_followers = ___(___)
)