Токенізація та підрахунок
Дослідіть вміст твітів авіаліній у twitter_data за допомогою підрахунку слів. Текст кожного твіта міститься у стовпці tweet_text.
Ця вправа є частиною курсу
Вступ до аналізу тексту в R
Інструкції до вправи
- Завантажте пакети tidyverse і tidytext.
- Проведіть токенізацію твітів у стовпці
tweet_text. - Обчисліть підрахунки слів на основі токенізованого тексту.
- Відсортуйте підрахунки у спадному порядку.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the tidyverse and tidytext packages
___(___)
___(___)
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(word, ___)
tidy_twitter %>%
# Compute word counts
___(___) %>%
# Arrange the counts in descending order
___(___)