НачатьНачать бесплатно

Сгруппированные сводки

Итак, в twitter_data записей без жалоб больше, чем записей с жалобами. Возможно, вы уже начинаете сомневаться, действительно ли эти данные взяты из Twitter! Перед тем как перейти непосредственно к текстам твитов, стоит изучить ещё несколько интересных столбцов в twitter_data. Каждый твит содержит информацию о количестве подписчиков пользователя в столбце usr_followers_count. Как вы думаете: у тех, кто пишет жалобы, в среднем больше или меньше подписчиков, чем у остальных? Сгруппированные сводки помогут быстро найти ответ.

Это упражнение является частью курса

Введение в анализ текста на R

Посмотреть курс

Инструкции к упражнению

  • Сгруппируйте данные по столбцу complaint_label.
  • Вычислите среднее, минимальное и максимальное значения столбца usr_followers_count.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Start with the data frame
___ %>% 
  # Group the data by whether or not the tweet is a complaint
  ___(___) %>% 
  # Compute the mean, min, and max follower counts
  summarize(
    avg_followers = ___(___),
    min_followers = ___(___),
    max_followers = ___(___)
  )
Редактировать и запускать код