НачатьНачать бесплатно

Очистка и подсчёт

Удалите стоп-слова, чтобы изучить содержание только тех твитов из twitter_data, которые классифицированы как жалобы.

Это упражнение является частью курса

Введение в анализ текста на R

Посмотреть курс

Инструкции к упражнению

  • Токенизируйте твиты из twitter_data. Назовите столбец с токенизированными словами word.
  • Удалите стандартные стоп-слова из токенизированного twitter_data.
  • Отфильтруйте данные, оставив только жалобы.
  • Вычислите частоту слов на основе очищенного токенизированного текста и отсортируйте результаты по убыванию счётчика.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
Редактировать и запускать код