Convertir le vecteur en objet VCorpus (2)
Maintenant que nous avons converti notre vecteur en objet Source, nous le passons à une autre fonction de tm, VCorpus(), pour créer notre corpus volatil. Assez simple, n'est-ce pas?
L'objet VCorpus est une liste imbriquée, ou liste de listes. À chaque indice de l'objet VCorpus, on trouve un objet PlainTextDocument, qui est une liste contenant les données textuelles proprement dites (content) et des métadonnées correspondantes (meta). Il peut être utile de visualiser un objet VCorpus pour mieux en saisir l'ensemble.
Pour examiner un seul document (le 10e), on fait un sous-ensemble avec des doubles crochets.
coffee_corpus[[10]]
Pour afficher le texte lui-même, vous indexez la liste deux fois. Pour accéder aux métadonnées du document, comme l'horodatage, remplacez [1] par [2]. Une autre façon d'examiner le texte brut est d'utiliser la fonction content(), qui n'a pas besoin du deuxième ensemble de crochets.
coffee_corpus[[10]][1]
content(coffee_corpus[[10]])
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Instructions de l’exercice
- Appelez la fonction
VCorpus()sur l'objetcoffee_sourcepour créercoffee_corpus. - Vérifiez que
coffee_corpusest un objetVCorpusen l'affichant dans la console. - Affichez le 15e élément de
coffee_corpusdans la console pour vérifier qu'il s'agit d'unPlainTextDocumentqui contient le contenu et les métadonnées du 15e tweet. Utilisez la sélection avec doubles crochets. - Affichez le contenu du 15e tweet dans
coffee_corpus. Utilisez des doubles crochets pour sélectionner le bon tweet, suivis de crochets simples pour extraire le contenu de ce tweet. - Affichez le
content()du 10e tweet danscoffee_corpus
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
## coffee_source is already in your workspace
# Make a volatile corpus from coffee_source
coffee_corpus <- ___
# Print out coffee_corpus
___
# Print the 15th tweet in coffee_corpus
___
# Print the contents of the 15th tweet in coffee_corpus
___
# Now use content to review the plain text of the 10th tweet
___(___[[___]])