CommencezCommencez gratuitement

Convertir le vecteur en objet VCorpus (2)

Maintenant que nous avons converti notre vecteur en objet Source, nous le passons à une autre fonction de tm, VCorpus(), pour créer notre corpus volatil. Assez simple, n'est-ce pas?

L'objet VCorpus est une liste imbriquée, ou liste de listes. À chaque indice de l'objet VCorpus, on trouve un objet PlainTextDocument, qui est une liste contenant les données textuelles proprement dites (content) et des métadonnées correspondantes (meta). Il peut être utile de visualiser un objet VCorpus pour mieux en saisir l'ensemble.

Pour examiner un seul document (le 10e), on fait un sous-ensemble avec des doubles crochets.

coffee_corpus[[10]]

Pour afficher le texte lui-même, vous indexez la liste deux fois. Pour accéder aux métadonnées du document, comme l'horodatage, remplacez [1] par [2]. Une autre façon d'examiner le texte brut est d'utiliser la fonction content(), qui n'a pas besoin du deuxième ensemble de crochets.

coffee_corpus[[10]][1]

content(coffee_corpus[[10]])

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

  • Appelez la fonction VCorpus() sur l'objet coffee_source pour créer coffee_corpus.
  • Vérifiez que coffee_corpus est un objet VCorpus en l'affichant dans la console.
  • Affichez le 15e élément de coffee_corpus dans la console pour vérifier qu'il s'agit d'un PlainTextDocument qui contient le contenu et les métadonnées du 15e tweet. Utilisez la sélection avec doubles crochets.
  • Affichez le contenu du 15e tweet dans coffee_corpus. Utilisez des doubles crochets pour sélectionner le bon tweet, suivis de crochets simples pour extraire le contenu de ce tweet.
  • Affichez le content() du 10e tweet dans coffee_corpus

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

## coffee_source is already in your workspace

# Make a volatile corpus from coffee_source
coffee_corpus <- ___

# Print out coffee_corpus
___

# Print the 15th tweet in coffee_corpus
___

# Print the contents of the 15th tweet in coffee_corpus
___

# Now use content to review the plain text of the 10th tweet
___(___[[___]])
Modifier et exécuter le code