CommencezCommencez gratuitement

Capter les métadonnées dans tm

Selon ce que vous cherchez à faire, vous pourriez vouloir conserver des métadonnées sur le document au moment de créer un corpus.

Pour capter des métadonnées au niveau du document, les noms et l'ordre des colonnes doivent être :

  1. doc_id — une chaîne unique pour chaque document
  2. text — le texte à analyser
  3. ... — toute autre colonne sera automatiquement répertoriée comme métadonnées.

Il faudra parfois renommer des colonnes pour respecter les attentes de DataframeSource(). La fonction names() est utile pour cela.

tweets existe dans votre espace de travail comme trame de données avec les colonnes « num », « text », « screenName » et « created ».

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Renommez la première colonne de tweets en « doc_id ».
  • Définissez le schéma du document avec DataframeSource() sur la trame de données tweets réduite.
  • Transformez l'ensemble de documents en un corpus volatile imbriqué dans la fonction personnalisée clean_corpus().
  • Appliquez content() au premier tweet avec des crochets doubles, par exemple text_corpus[[1]], pour voir le texte brut nettoyé.
  • Confirmez que toutes les métadonnées ont été captées en utilisant la fonction meta() sur le premier document avec des crochets simples.

Rappelez-vous : lorsqu'on accède à une partie d'un corpus, les crochets doubles ou simples font une différence ! Pour cet exercice, vous utiliserez des crochets doubles avec content() et des crochets simples avec meta().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Rename columns
___(tweets)[1] <- "___"

# Set the schema: docs
docs <- ___(___)

# Make a clean volatile corpus: text_corpus
text_corpus <- clean_corpus(___(___))

# Examine the first doc content
___(text_corpus[[___]])

# Access the first doc metadata
___(text_corpus[___])
Modifier et exécuter le code