Trouver les mots communs
Supposons que vous vouliez visualiser les mots communs à travers plusieurs documents. Vous pouvez le faire avec commonality.cloud().
Chacun de nos corpus « coffee » et « chardonnay » est composé de nombreux tweets individuels. Pour traiter les tweets « coffee » comme un seul document, et de même pour « chardonnay », vous regroupez (paste()) tous les tweets de chaque corpus en utilisant le paramètre collapse = " ". Cela fusionne tous les tweets (séparés par un espace) en un seul vecteur. Vous pouvez ensuite créer un vecteur unique contenant les deux documents regroupés.
a_single_string <- paste(a_character_vector, collapse = " ")
Une fois ces étapes terminées, vous pouvez reprendre la même approche que précédemment pour créer un VCorpus() à partir d'un VectorSource issu de l'objet all_tweets.
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Créez
all_coffeeen utilisantpaste()aveccollapse = " "surcoffee_tweets$text. - Créez
all_chardonnayen utilisantpaste()aveccollapse = " "surchardonnay_tweets$text. - Créez
all_tweetsen utilisantc()pour combinerall_coffeeetall_chardonnay. Mettezall_coffeeen premier. - Convertissez
all_tweetsavecVectorSource(). - Créez
all_corpusen utilisantVCorpus()surall_tweets.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create all_coffee
___ <- ___(___, ___)
# Create all_chardonnay
___ <- ___(___, ___)
# Create all_tweets
___ <- ___(___, ___)
# Convert to a vector source
___ <- ___(___)
# Create all_corpus
___ <- ___(___)