Capter les métadonnées dans tm
Selon ce que vous cherchez à faire, vous pourriez vouloir conserver des métadonnées sur le document au moment de créer un corpus.
Pour capter des métadonnées au niveau du document, les noms et l'ordre des colonnes doivent être :
doc_id— une chaîne unique pour chaque documenttext— le texte à analyser...— toute autre colonne sera automatiquement répertoriée comme métadonnées.
Il faudra parfois renommer des colonnes pour respecter les attentes de DataframeSource(). La fonction names() est utile pour cela.
tweets existe dans votre espace de travail comme trame de données avec les colonnes « num », « text », « screenName » et « created ».
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Renommez la première colonne de
tweetsen « doc_id ». - Définissez le schéma du document avec
DataframeSource()sur la trame de donnéestweetsréduite. - Transformez l'ensemble de documents en un corpus volatile imbriqué dans la fonction personnalisée
clean_corpus(). - Appliquez
content()au premier tweet avec des crochets doubles, par exempletext_corpus[[1]], pour voir le texte brut nettoyé. - Confirmez que toutes les métadonnées ont été captées en utilisant la fonction
meta()sur le premier document avec des crochets simples.
Rappelez-vous : lorsqu'on accède à une partie d'un corpus, les crochets doubles ou simples font une différence ! Pour cet exercice, vous utiliserez des crochets doubles avec content() et des crochets simples avec meta().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Rename columns
___(tweets)[1] <- "___"
# Set the schema: docs
docs <- ___(___)
# Make a clean volatile corpus: text_corpus
text_corpus <- clean_corpus(___(___))
# Examine the first doc content
___(text_corpus[[___]])
# Access the first doc metadata
___(text_corpus[___])