Treemaps para grupos de documentos
A menudo trabajarás con documentos agrupados, por ejemplo por autor, producto o empresa. Este ejercicio te permite conocer el texto manteniendo los grupos en una visualización compacta. Por ejemplo, con reseñas de clientes agrupadas por producto, puede interesarte explorar varias dimensiones de las reseñas al mismo tiempo. Primero podrías calcular la polarity() de las reseñas. Otra dimensión puede ser la longitud. La longitud del documento puede reflejar la intensidad emocional. Si un cliente deja un breve "great shoes!", se podría inferir que en realidad está menos entusiasmado que en una reseña positiva más extensa. También puedes querer agrupar reseñas por tipo de producto, como zapatos de mujer, de hombre y de niña/niño. Un treemap te permite examinar todas estas dimensiones.
Para el análisis de texto, dentro de un treemap cada recuadro individual representa un documento, como un tuit. Los documentos se agrupan de alguna manera, como por autor. El tamaño de cada recuadro se determina por un valor numérico, como el número de palabras o de letras. Los colores individuales se determinan por una puntuación de sentimiento.
Después de organizar el tibble, utiliza la librería treemap, que contiene la función treemap(), para crear la visualización. El ejemplo de código siguiente declara los datos, las variables de agrupación, el tamaño, el color y otros aspectos estéticos.
treemap(
data_frame,
index = c("group", "individual_document"),
vSize = "doc_length",
vColor = "avg_score",
type = "value",
title = "Sentiment Scores by Doc",
palette = c("red", "white", "green")
)
El objeto precargado all_books contiene un corpus combinado en formato tidy con 4 libros de Shakespeare, 3 de Melville y 4 de Twain. A partir del treemap deberías poder ver quién escribe libros más largos, y la polaridad del autor en su conjunto y de cada libro individual.
Este ejercicio forma parte del curso
Análisis de sentimiento en R
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
book_length <- all_books %>%
# Count number of words per book
___(___)
# Examine the results
book_length