Очищення та підрахунок
Вилучіть стоп-слова, щоб дослідити зміст лише тих твітів авіаліній у twitter_data, які класифіковані як скарги.
Ця вправа є частиною курсу
Вступ до аналізу тексту в R
Інструкції до вправи
- Токенізуйте твіти в
twitter_data. Назвіть стовпець із токенізованими словамиword. - Вилучіть типові стоп-слова з токенізованих
twitter_data. - Відфільтруйте, щоб залишити лише скарги.
- Обчисліть частоти слів, використовуючи токенізований очищений текст, і відсортуйте за спаданням за кількістю.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)