CommencezCommencez gratuitement

Trouver les mots communs

Supposons que vous vouliez visualiser les mots communs à travers plusieurs documents. Vous pouvez le faire avec commonality.cloud().

Chacun de nos corpus « coffee » et « chardonnay » est composé de nombreux tweets individuels. Pour traiter les tweets « coffee » comme un seul document, et de même pour « chardonnay », vous regroupez (paste()) tous les tweets de chaque corpus en utilisant le paramètre collapse = " ". Cela fusionne tous les tweets (séparés par un espace) en un seul vecteur. Vous pouvez ensuite créer un vecteur unique contenant les deux documents regroupés.

a_single_string <- paste(a_character_vector, collapse = " ")

Une fois ces étapes terminées, vous pouvez reprendre la même approche que précédemment pour créer un VCorpus() à partir d'un VectorSource issu de l'objet all_tweets.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Créez all_coffee en utilisant paste() avec collapse = " " sur coffee_tweets$text.
  • Créez all_chardonnay en utilisant paste() avec collapse = " " sur chardonnay_tweets$text.
  • Créez all_tweets en utilisant c() pour combiner all_coffee et all_chardonnay. Mettez all_coffee en premier.
  • Convertissez all_tweets avec VectorSource().
  • Créez all_corpus en utilisant VCorpus() sur all_tweets.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create all_coffee
___ <- ___(___, ___)

# Create all_chardonnay
___ <- ___(___, ___)

# Create all_tweets
___ <- ___(___, ___)

# Convert to a vector source
___ <- ___(___)

# Create all_corpus
___ <- ___(___)
Modifier et exécuter le code