НачатьНачать бесплатно

Токенизация и подсчёт слов

Изучите содержимое твитов об авиакомпаниях из набора данных twitter_data с помощью подсчёта слов. Текст каждого твита находится в столбце tweet_text.

Это упражнение является частью курса

Введение в анализ текста на R

Посмотреть курс

Инструкции к упражнению

  • Загрузите пакеты tidyverse и tidytext.
  • Токенизируйте твиты из столбца tweet_text.
  • Подсчитайте частоту слов на основе токенизированного текста.
  • Отсортируйте результаты подсчёта в порядке убывания.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load the tidyverse and tidytext packages
___(___)
___(___)

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(word, ___) 

tidy_twitter %>% 
  # Compute word counts
  ___(___) %>% 
  # Arrange the counts in descending order
  ___(___)
Редактировать и запускать код