CommencerCommencez gratuitement

Créer un corpus

Vous avez créé un tibble appelé russian_tweets qui contient environ 20 000 tweets générés automatiquement par des bots pendant l’élection américaine de 2016, afin de pouvoir réaliser une analyse de texte. Cependant, en passant en revue les options disponibles pour mener l’analyse que vous avez choisie, vous pensez que le package tm offre la voie la plus simple. Pour conduire l’analyse, vous devez d’abord créer un corpus et y associer des métadonnées potentiellement utiles.

Sachez qu’il s’agit de données réelles provenant de Twitter ; il existe donc un risque qu’elles contiennent des grossièretés ou d’autres contenus offensants (dans cet exercice et dans tout exercice ultérieur utilisant également de vraies données Twitter).

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Créez un corpus en utilisant la colonne content de russian_tweets.
  • Ajoutez les colonnes following et followers comme métadonnées à tweet_corpus.
  • Affichez les premières lignes du tableau des métadonnées.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))

# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___

# Review the meta data
head(meta(___))
Modifier et exécuter le code