Очистка и подсчёт
Удалите стоп-слова, чтобы изучить содержание только тех твитов из twitter_data, которые классифицированы как жалобы.
Это упражнение является частью курса
Введение в анализ текста на R
Инструкции к упражнению
- Токенизируйте твиты из
twitter_data. Назовите столбец с токенизированными словамиword. - Удалите стандартные стоп-слова из токенизированного
twitter_data. - Отфильтруйте данные, оставив только жалобы.
- Вычислите частоту слов на основе очищенного токенизированного текста и отсортируйте результаты по убыванию счётчика.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)