Comece agoraComece grátis

Treemaps para grupos de documentos

Muitas vezes você vai trabalhar com documentos em grupos, como por autor, produto ou empresa. Este exercício permite explorar o texto mantendo os grupos em uma visualização compacta. Por exemplo, com avaliações de clientes agrupadas por produto, você pode querer explorar várias dimensões dessas avaliações ao mesmo tempo. Primeiro, você poderia calcular a polarity() das avaliações. Outra dimensão pode ser o comprimento. O tamanho do documento pode indicar a intensidade emocional. Se um cliente deixa um breve "great shoes!", dá para inferir que ele está menos entusiasmado do que em uma avaliação positiva mais longa. Você também pode querer agrupar as avaliações por tipo de produto, como sapatos femininos, masculinos e infantis. Um treemap permite examinar todas essas dimensões.

Para análise de texto, em um treemap cada caixa individual representa um documento, como um tuíte. Os documentos são agrupados de alguma forma, como por autor. O tamanho de cada caixa é determinado por um valor numérico, como número de palavras ou letras. As cores individuais são determinadas por uma pontuação de sentimento.

Depois de organizar o tibble, você usa a biblioteca treemap, que contém a função treemap(), para criar a visualização. O exemplo de código abaixo declara os dados, variáveis de agrupamento, tamanho, cor e outros aspectos visuais.

treemap(
  data_frame,
  index = c("group", "individual_document"),
  vSize = "doc_length",
  vColor = "avg_score",
  type = "value",
  title = "Sentiment Scores by Doc",
  palette = c("red", "white", "green")
)

O objeto pré-carregado all_books contém um corpus combinado em formato tidy com 4 livros de Shakespeare, 3 de Melville e 4 de Twain. Com base no treemap, você deve conseguir identificar quem escreve livros mais longos e a polaridade do autor como um todo e de cada livro individualmente.

Este exercicio faz parte do curso

Análise de Sentimentos em R

Ver curso

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

book_length <- all_books %>%
  # Count number of words per book
  ___(___)
  
# Examine the results
book_length
Editar e Executar Código