Карты дерева для групп документов
В работе вы часто будете сталкиваться с документами, объединёнными в группы — по автору, продукту или компании. Это упражнение поможет вам изучить текст, сохранив при этом группировку в компактной визуализации. Например, при анализе отзывов покупателей, сгруппированных по продукту, может потребоваться одновременно исследовать несколько измерений. Сначала можно вычислить polarity() отзывов. Ещё одним измерением может служить длина документа: она способна отражать эмоциональную интенсивность. Если покупатель оставил короткий отзыв «отличные туфли!», можно предположить, что его энтузиазм ниже, чем у автора развёрнутого положительного отзыва. Кроме того, можно группировать отзывы по типу товара — например, женская, мужская и детская обувь. Карта дерева позволяет исследовать все эти измерения одновременно.
При анализе текста каждый отдельный прямоугольник карты дерева представляет один документ — например, твит. Документы объединяются в группы, например по автору. Размер каждого прямоугольника определяется числовым значением — например, количеством слов или символов. Цвет каждого прямоугольника определяется оценкой тональности.
После подготовки tibble используйте библиотеку treemap с функцией treemap() для создания визуализации. В приведённом ниже примере кода задаются данные, переменные группировки, размер, цвет и другие параметры отображения.
treemap(
data_frame,
index = c("group", "individual_document"),
vSize = "doc_length",
vColor = "avg_score",
type = "value",
title = "Sentiment Scores by Doc",
palette = c("red", "white", "green")
)
Предзагруженный объект all_books содержит объединённый корпус в аккуратном формате: 4 книги Шекспира, 3 книги Мелвилла и 4 книги Твена. По карте дерева вы сможете определить, кто из авторов пишет более длинные книги, а также оценить общую тональность каждого автора и отдельных произведений.
Это упражнение является частью курса
Анализ тональности в R
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
book_length <- all_books %>%
# Count number of words per book
___(___)
# Examine the results
book_length