Подсчёт по продукту и изменение порядка
Набор данных tidy_twitter токенизирован, стоп-слова (в том числе пользовательские) удалены. Вы хотите визуализировать различия в частоте слов между жалобами и не-жалобами.
Это упражнение является частью курса
Введение в анализ текста на R
Инструкции к упражнению
- Подсчитайте слова с учётом того, является ли сообщение жалобой или нет.
- Оставьте 20 наиболее частых слов для каждой группы (жалобы и не-жалобы).
- Разгруппируйте данные перед тем, как переупорядочить слова как фактор по количеству вхождений.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
word_counts <- tidy_twitter %>%
# Count words by whether or not its a complaint
___(___, ___) %>%
# Group by whether or not its a complaint
group_by(___) %>%
# Keep the top 20 words
___(___, ___) %>%
# Ungroup before reordering word as a factor by the count
___() %>%
___(word2 = ___(___, ___))