CommencezCommencez gratuitement

Nuage d'étiquettes polarisé

Les nuages de mots en commun (commonality clouds) montrent les mots partagés entre des documents. Ce qu'ils ne permettent pas de voir facilement, toutefois, c'est lesquels de ces mots sont plus fréquents dans un document que dans un autre. Pour cela, il vous faut un diagramme en pyramide; on peut en générer avec pyramid.plot() du paquet plotrix.

D'abord, il faut transformer un peu les données pour obtenir un format approprié. Le plus simple est de convertir en trame de données et d'utiliser dplyr. À partir d'une matrice de fréquences de mots, comme celle créée avec as.matrix(tdm), vous devez obtenir une trame de données à trois colonnes :

  • Les mots présents dans chaque document.
  • Les comptes de ces mots pour le document 1.
  • Les comptes de ces mots pour le document 2.

Ensuite, utilisez pyramid.plot() ainsi :

pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)

Il existe quelques arguments additionnels pour améliorer l'apparence du graphique.

Vous allez maintenant explorer les mots fréquents dans les tweets sur le chardonnay, mais rares dans ceux sur le café. all_dtm_m est déjà créé pour vous.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

top25_df <- all_tdm_m %>%
  # Convert to data frame
  as_tibble(rownames = "___") %>% 
  # Keep rows where word appears everywhere
  filter(if_all(everything(), ___) %>% 
  # Get difference in counts
  mutate(difference = ___) %>% 
  # Keep rows with biggest difference
  slice_max(___,  n = ___) %>% 
  # Arrange by descending difference
  arrange(___(___))
Modifier et exécuter le code