CommencerCommencez gratuitement

Treemaps pour des groupes de documents

Vous travaillerez souvent avec des documents regroupés, par exemple par auteur, par produit ou par entreprise. Cet exercice vous permet d'explorer le texte tout en conservant les groupes dans un visuel compact. Par exemple, avec des avis clients regroupés par produit, vous pouvez explorer plusieurs dimensions des avis en même temps. Vous pourriez d'abord calculer la polarity() des avis. Une autre dimension peut être la longueur. La longueur d'un document peut refléter l'intensité émotionnelle. Si un client laisse un court « great shoes! », on peut en déduire qu'il est en réalité moins enthousiaste que dans un avis positif plus développé. Vous pouvez aussi regrouper les avis par type de produit, comme chaussures pour femmes, hommes et enfants. Un treemap vous permet d'examiner toutes ces dimensions.

Pour l'analyse de texte, dans un treemap, chaque case représente un document, comme un tweet. Les documents sont regroupés d'une certaine manière, par exemple par auteur. La taille de chaque case est déterminée par une valeur numérique, comme le nombre de mots ou de lettres. Les couleurs individuelles sont déterminées par un score de sentiment.

Après avoir organisé la tibble, utilisez la bibliothèque treemap contenant la fonction treemap() pour créer le visuel. L'exemple de code ci-dessous déclare les données, les variables de regroupement, la taille, la couleur et d'autres paramètres esthétiques.

treemap(
  data_frame,
  index = c("group", "individual_document"),
  vSize = "doc_length",
  vColor = "avg_score",
  type = "value",
  title = "Sentiment Scores by Doc",
  palette = c("red", "white", "green")
)

L'objet préchargé all_books contient un corpus combiné au format tidy avec 4 livres de Shakespeare, 3 de Melville et 4 de Twain. À partir du treemap, vous devriez pouvoir voir qui écrit les livres les plus longs, ainsi que la polarité de l'auteur dans son ensemble et pour chaque livre.

Cet exercice fait partie du cours

<cours>Analyse de sentiments en R</cours>
Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

book_length <- all_books %>%
  # Count number of words per book
  ___(___)
  
# Examine the results
book_length
Modifier et exécuter le code