CommencezCommencez gratuitement

Cartes en treillis (treemaps) pour des groupes de documents

Vous travaillerez souvent avec des documents regroupés, par exemple par auteur, produit ou entreprise. Cet exercice vous permet d'explorer le texte tout en conservant les groupes dans une visualisation compacte. Par exemple, avec des avis de clients groupés par produit, vous pourriez vouloir examiner plusieurs dimensions des avis en même temps. Vous pourriez d'abord calculer la polarity() des avis. Une autre dimension pourrait être la longueur. La longueur d'un document peut indiquer l'intensité émotionnelle. Si un client laisse un court « great shoes! », on peut en déduire qu'il est en fait moins enthousiaste qu'un avis positif plus long. Vous pourriez aussi vouloir regrouper les avis par type de produit, comme chaussures pour femmes, pour hommes et pour enfants. Une carte en treillis vous permet d'examiner toutes ces dimensions.

Pour l'analyse de texte, dans une carte en treillis, chaque case représente un document, comme un tweet. Les documents sont regroupés d'une certaine manière, par exemple par auteur. La taille de chaque case est déterminée par une valeur numérique, comme le nombre de mots ou de lettres. Les couleurs individuelles sont déterminées par une cote de sentiment.

Après avoir organisé le tibble, utilisez la bibliothèque treemap qui contient la fonction treemap() pour créer la visualisation. L'exemple de code ci-dessous précise les données, les variables de regroupement, la taille, la couleur et d'autres paramètres visuels.

treemap(
  data_frame,
  index = c("group", "individual_document"),
  vSize = "doc_length",
  vColor = "avg_score",
  type = "value",
  title = "Sentiment Scores by Doc",
  palette = c("red", "white", "green")
)

L'objet all_books préchargé contient un corpus combiné en format tidy avec 4 livres de Shakespeare, 3 de Melville et 4 de Twain. À partir de la carte en treillis, vous devriez être en mesure de voir qui écrit des livres plus longs, ainsi que la polarité de l'auteur dans son ensemble et pour chaque livre individuel.

Cette activité fait partie du cours

Analyse de sentiment en R

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

book_length <- all_books %>%
  # Count number of words per book
  ___(___)
  
# Examine the results
book_length
Modifier et exécuter le code