CommencezCommencez gratuitement

Transformer le vecteur en objet VCorpus (1)

Rappelez-vous que vous avez chargé vos données textuelles dans un vecteur appelé coffee_tweets dans le dernier exercice. Votre prochaine étape consiste à convertir ce vecteur qui contient les données textuelles en un corpus. Comme vous l'avez vu dans la vidéo, un corpus est un ensemble de documents, mais il est aussi important de savoir que dans l'univers de tm, R le reconnaît comme un type de données.

Il existe deux types de corpus, le corpus permanent (PCorpus) et le corpus volatile (VCorpus). Essentiellement, la différence entre les deux tient à la façon dont l'ensemble de documents est stocké sur votre ordinateur. Dans ce cours, nous utiliserons le corpus volatile, qui est conservé dans la mémoire vive (RAM) de votre ordinateur plutôt qu'enregistré sur le disque, afin d'être plus efficace en mémoire.

Pour créer un corpus volatile, R doit interpréter chaque élément de notre vecteur de texte, coffee_tweets, comme un document. Et le package tm offre ce qu'on appelle des fonctions Source pour faire exactement cela ! Dans cet exercice, nous utiliserons une fonction Source appelée VectorSource() parce que nos données textuelles se trouvent dans un vecteur. La sortie de cette fonction s'appelle un objet Source. À vous de jouer !

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Chargez le package tm.
  • Créez un objet Source à partir du vecteur coffee_tweets. Nommez ce nouvel objet coffee_source.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load tm
___

# Make a vector source from coffee_tweets
___
Modifier et exécuter le code