НачатьНачать бесплатно

Карты дерева для групп документов

В работе вы часто будете сталкиваться с документами, объединёнными в группы — по автору, продукту или компании. Это упражнение поможет вам изучить текст, сохранив при этом группировку в компактной визуализации. Например, при анализе отзывов покупателей, сгруппированных по продукту, может потребоваться одновременно исследовать несколько измерений. Сначала можно вычислить polarity() отзывов. Ещё одним измерением может служить длина документа: она способна отражать эмоциональную интенсивность. Если покупатель оставил короткий отзыв «отличные туфли!», можно предположить, что его энтузиазм ниже, чем у автора развёрнутого положительного отзыва. Кроме того, можно группировать отзывы по типу товара — например, женская, мужская и детская обувь. Карта дерева позволяет исследовать все эти измерения одновременно.

При анализе текста каждый отдельный прямоугольник карты дерева представляет один документ — например, твит. Документы объединяются в группы, например по автору. Размер каждого прямоугольника определяется числовым значением — например, количеством слов или символов. Цвет каждого прямоугольника определяется оценкой тональности.

После подготовки tibble используйте библиотеку treemap с функцией treemap() для создания визуализации. В приведённом ниже примере кода задаются данные, переменные группировки, размер, цвет и другие параметры отображения.

treemap(
  data_frame,
  index = c("group", "individual_document"),
  vSize = "doc_length",
  vColor = "avg_score",
  type = "value",
  title = "Sentiment Scores by Doc",
  palette = c("red", "white", "green")
)

Предзагруженный объект all_books содержит объединённый корпус в аккуратном формате: 4 книги Шекспира, 3 книги Мелвилла и 4 книги Твена. По карте дерева вы сможете определить, кто из авторов пишет более длинные книги, а также оценить общую тональность каждого автора и отдельных произведений.

Это упражнение является частью курса

Анализ тональности в R

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

book_length <- all_books %>%
  # Count number of words per book
  ___(___)
  
# Examine the results
book_length
Редактировать и запускать код