Подсчёт типов пользователей
Подсчёт значений — ключевой способ обобщить категориальные данные. Поскольку текст относится к категориальному типу, важно уметь уверенно работать с подсчётами. Набор данных twitter_data состоит из жалоб и сообщений, не являющихся жалобами: это указано в столбце complaint_label. Также в нём есть столбец usr_verified, который показывает, является ли пользователь верифицированным (то есть подтверждённым Twitter). Обратите внимание: этот столбец имеет тип <lgl>, то есть логический. Интересно, верифицированные пользователи жалуются чаще?
Это упражнение является частью курса
Введение в анализ текста на R
Инструкции к упражнению
- Загрузите пакет
tidyverse, который включаетdplyrиggplot2. - Отфильтруйте данные, оставив только твиты-жалобы.
- Подсчитайте количество верифицированных и неверифицированных пользователей среди тех, кто оставил жалобы.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the tidyverse package
___(___)
twitter_data %>%
# Filter for just the complaints
___(___) %>%
# Count the number of verified and non-verified users
___(___)