Nuage d'étiquettes polarisé
Les nuages de mots en commun (commonality clouds) montrent les mots partagés entre des documents. Ce qu'ils ne permettent pas de voir facilement, toutefois, c'est lesquels de ces mots sont plus fréquents dans un document que dans un autre. Pour cela, il vous faut un diagramme en pyramide; on peut en générer avec pyramid.plot() du paquet plotrix.
D'abord, il faut transformer un peu les données pour obtenir un format approprié. Le plus simple est de convertir en trame de données et d'utiliser dplyr. À partir d'une matrice de fréquences de mots, comme celle créée avec as.matrix(tdm), vous devez obtenir une trame de données à trois colonnes :
- Les mots présents dans chaque document.
- Les comptes de ces mots pour le document 1.
- Les comptes de ces mots pour le document 2.
Ensuite, utilisez pyramid.plot() ainsi :
pyramid.plot(word_count_data$count1, word_count_data$count2, word_count_data$word)
Il existe quelques arguments additionnels pour améliorer l'apparence du graphique.
Vous allez maintenant explorer les mots fréquents dans les tweets sur le chardonnay, mais rares dans ceux sur le café. all_dtm_m est déjà créé pour vous.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
top25_df <- all_tdm_m %>%
# Convert to data frame
as_tibble(rownames = "___") %>%
# Keep rows where word appears everywhere
filter(if_all(everything(), ___) %>%
# Get difference in counts
mutate(difference = ___) %>%
# Keep rows with biggest difference
slice_max(___, n = ___) %>%
# Arrange by descending difference
arrange(___(___))