Токенизация и подсчёт слов
Изучите содержимое твитов об авиакомпаниях из набора данных twitter_data с помощью подсчёта слов. Текст каждого твита находится в столбце tweet_text.
Это упражнение является частью курса
Введение в анализ текста на R
Инструкции к упражнению
- Загрузите пакеты tidyverse и tidytext.
- Токенизируйте твиты из столбца
tweet_text. - Подсчитайте частоту слов на основе токенизированного текста.
- Отсортируйте результаты подсчёта в порядке убывания.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the tidyverse and tidytext packages
___(___)
___(___)
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(word, ___)
tidy_twitter %>%
# Compute word counts
___(___) %>%
# Arrange the counts in descending order
___(___)