Visualiser les mots différents
Supposons que vous vouliez visualiser les mots qui ne sont pas en commun. Pour ce faire, vous pouvez aussi utiliser comparison.cloud(), et les étapes sont très similaires, avec une principale différence.
Comme lorsque vous cherchiez des mots en commun, vous commencez par regrouper les tweets en corpus distincts et à les combiner dans leur propre objet VCorpus(). Ensuite, appliquez une fonction clean_corpus() et organisez le tout en TermDocumentMatrix.
Pour suivre quels mots appartiennent à coffee par opposition à chardonnay, vous pouvez définir les noms de colonnes du TDM ainsi :
colnames(all_tdm) <- c("chardonnay", "coffee")
Enfin, convertissez l'objet en matrice avec as.matrix() pour l'utiliser dans comparison.cloud(). Pour chaque corpus distinct transmis à comparison.cloud(), vous pouvez préciser une couleur, par exemple colors = c("red", "yellow", "green"), afin de rendre les sections faciles à distinguer.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
all_corpus est préchargé dans votre espace de travail.
- Créez
all_cleanen appliquant la fonction prédéfinieclean_corpusàall_corpus. - Créez
all_tdm, unTermDocumentMatrix, à partir deall_clean. - Utilisez
colnames()pour renommer chaque corpus distinct dansall_tdm. Nommez la première colonne « coffee » et la deuxième colonne « chardonnay ». - Créez
all_men convertissantall_tdmen matrice. - Créez un
comparison.cloud()en utilisantall_m, aveccolors = c("orange", "blue")etmax.words = 50.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Clean the corpus
___ <- ___(___)
# Create all_tdm
___ <- ___(___)
# Give the columns distinct names
___(___) <- ___
# Create all_m
___ <- ___(___)
# Create comparison cloud
comparison.cloud(___, ___ = c("___", "___"), max.words = ___)