Transformer le vecteur en objet VCorpus (1)
Rappelez-vous que vous avez chargé vos données textuelles dans un vecteur appelé coffee_tweets dans le dernier exercice. Votre prochaine étape consiste à convertir ce vecteur qui contient les données textuelles en un corpus. Comme vous l'avez vu dans la vidéo, un corpus est un ensemble de documents, mais il est aussi important de savoir que dans l'univers de tm, R le reconnaît comme un type de données.
Il existe deux types de corpus, le corpus permanent (PCorpus) et le corpus volatile (VCorpus). Essentiellement, la différence entre les deux tient à la façon dont l'ensemble de documents est stocké sur votre ordinateur. Dans ce cours, nous utiliserons le corpus volatile, qui est conservé dans la mémoire vive (RAM) de votre ordinateur plutôt qu'enregistré sur le disque, afin d'être plus efficace en mémoire.
Pour créer un corpus volatile, R doit interpréter chaque élément de notre vecteur de texte, coffee_tweets, comme un document. Et le package tm offre ce qu'on appelle des fonctions Source pour faire exactement cela ! Dans cet exercice, nous utiliserons une fonction Source appelée VectorSource() parce que nos données textuelles se trouvent dans un vecteur. La sortie de cette fonction s'appelle un objet Source. À vous de jouer !
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Chargez le package
tm. - Créez un objet Source à partir du vecteur
coffee_tweets. Nommez ce nouvel objetcoffee_source.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load tm
___
# Make a vector source from coffee_tweets
___