Визуализация частотности слов с помощью факторов
Мы уже добавили ряд пользовательских стоп-слов (включая названия авиакомпаний) и подготовили данные. Теперь вам предстоит создать улучшенную визуализацию и отобразить слова в порядке убывания их частотности.
Это упражнение является частью курса
Введение в анализ текста на R
Инструкции к упражнению
- Оставьте только те слова, которые встречаются более 100 раз в наборе данных
non_complaints. - Преобразуйте столбец
wordв фактор, упорядоченный по частотности слов. - Постройте столбчатую диаграмму, используя новый столбец со словами типа фактор.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
word_counts <- tidy_twitter %>%
filter(complaint_label == "Non-Complaint") %>%
count(word) %>%
# Keep terms that occur more than 100 times
___(___) %>%
# Reorder word as an ordered factor by word counts
___(word2 = ___(___, ___))
# Plot the new word column with type factor
___(___, aes(___, ___)) +
___() +
___() +
ggtitle("Non-Complaint Word Counts")