НачатьНачать бесплатно

Подсчёт по продукту и изменение порядка

Набор данных tidy_twitter токенизирован, стоп-слова (в том числе пользовательские) удалены. Вы хотите визуализировать различия в частоте слов между жалобами и не-жалобами.

Это упражнение является частью курса

Введение в анализ текста на R

Посмотреть курс

Инструкции к упражнению

  • Подсчитайте слова с учётом того, является ли сообщение жалобой или нет.
  • Оставьте 20 наиболее частых слов для каждой группы (жалобы и не-жалобы).
  • Разгруппируйте данные перед тем, как переупорядочить слова как фактор по количеству вхождений.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

word_counts <- tidy_twitter %>%
  # Count words by whether or not its a complaint
  ___(___, ___) %>%
  # Group by whether or not its a complaint
  group_by(___) %>%
  # Keep the top 20 words
  ___(___, ___) %>%
  # Ungroup before reordering word as a factor by the count
  ___() %>%
  ___(word2 = ___(___, ___))
Редактировать и запускать код