НачатьНачать бесплатно

Визуализация частотности слов с помощью факторов

Мы уже добавили ряд пользовательских стоп-слов (включая названия авиакомпаний) и подготовили данные. Теперь вам предстоит создать улучшенную визуализацию и отобразить слова в порядке убывания их частотности.

Это упражнение является частью курса

Введение в анализ текста на R

Посмотреть курс

Инструкции к упражнению

  • Оставьте только те слова, которые встречаются более 100 раз в наборе данных non_complaints.
  • Преобразуйте столбец word в фактор, упорядоченный по частотности слов.
  • Постройте столбчатую диаграмму, используя новый столбец со словами типа фактор.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

word_counts <- tidy_twitter %>% 
  filter(complaint_label == "Non-Complaint") %>% 
  count(word) %>% 
  # Keep terms that occur more than 100 times
  ___(___) %>% 
  # Reorder word as an ordered factor by word counts
  ___(word2 = ___(___, ___))

# Plot the new word column with type factor
___(___, aes(___, ___)) +
  ___() +
  ___() +
  ggtitle("Non-Complaint Word Counts")
Редактировать и запускать код