CommencezCommencez gratuitement

Créer un VCorpus à partir d'un tableau de données

Si vos données textuelles se trouvent dans un tableau de données, vous pouvez utiliser DataframeSource() pour votre analyse. Le tableau de données transmis à DataframeSource() doit avoir une structure précise :

  • La première colonne doit s'appeler doc_id et contenir une chaîne unique pour chaque ligne.
  • La deuxième colonne doit s'appeler text avec un encodage « UTF-8 » (tout à fait courant).
  • Toute autre colonne, 3+, est considérée comme des métadonnées et sera conservée comme telle.

Cet exercice présente meta() pour extraire les métadonnées associées à chaque document. Vos données contiendront souvent des métadonnées comme les auteur·trice·s, les dates, des étiquettes de sujet ou des lieux, qui peuvent éclairer votre analyse. Une fois votre texte transformé en corpus, vous pouvez appliquer meta() pour examiner l'information supplémentaire au niveau du document.

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

Dans votre espace de travail, il y a un tableau de données simple nommé example_text avec les bons noms de colonnes et quelques métadonnées. Il y a aussi vec_corpus, un corpus volatil créé avec VectorSource().

  • Créez df_source à l'aide de DataframeSource() avec example_text.
  • Créez df_corpus en convertissant df_source en objet corpus volatil avec VCorpus().
  • Affichez df_corpus. Remarquez le nombre de documents qu'il contient et le nombre de points de métadonnées conservés au niveau du document.
  • Utilisez meta() sur df_corpus pour afficher les métadonnées associées aux documents.
  • Examinez l'objet vec_corpus préchargé. Comparez le nombre de documents à celui de df_corpus.
  • Utilisez meta() sur vec_corpus pour comparer les métadonnées trouvées entre vec_corpus et df_corpus.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a DataframeSource from the example text
df_source <- ___

# Convert df_source to a volatile corpus
df_corpus <- ___

# Examine df_corpus
df_corpus

# Examine df_corpus metadata
___

# Compare the number of documents in the vector source
vec_corpus

# Compare metadata in the vector corpus
___
Modifier et exécuter le code