НачатьНачать бесплатно

Подсчёт типов пользователей

Подсчёт значений — ключевой способ обобщить категориальные данные. Поскольку текст относится к категориальному типу, важно уметь уверенно работать с подсчётами. Набор данных twitter_data состоит из жалоб и сообщений, не являющихся жалобами: это указано в столбце complaint_label. Также в нём есть столбец usr_verified, который показывает, является ли пользователь верифицированным (то есть подтверждённым Twitter). Обратите внимание: этот столбец имеет тип <lgl>, то есть логический. Интересно, верифицированные пользователи жалуются чаще?

Это упражнение является частью курса

Введение в анализ текста на R

Посмотреть курс

Инструкции к упражнению

  • Загрузите пакет tidyverse, который включает dplyr и ggplot2.
  • Отфильтруйте данные, оставив только твиты-жалобы.
  • Подсчитайте количество верифицированных и неверифицированных пользователей среди тех, кто оставил жалобы.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load the tidyverse package
___(___)

twitter_data %>% 
  # Filter for just the complaints
  ___(___) %>% 
  # Count the number of verified and non-verified users
  ___(___)
Редактировать и запускать код