CommencezCommencez gratuitement

Créer un corpus

Vous avez créé un tibble nommé russian_tweets qui contient environ 20 000 gazouillis générés automatiquement par des robots durant le cycle électoral américain de 2016 afin d'effectuer une analyse de texte. Toutefois, après avoir examiné les options disponibles pour réaliser l'analyse que vous avez choisie, vous pensez que le paquet tm est la voie la plus simple. Pour mener l'analyse, vous devez d'abord créer un corpus et y joindre des métadonnées potentiellement utiles.

Soyez conscient qu'il s'agit de véritables données de Twitter et qu'il y a donc toujours un risque qu'elles contiennent des grossièretés ou d'autres contenus offensants (dans cet exercice et dans tout exercice ultérieur utilisant aussi de vraies données de Twitter).

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Créez un corpus à partir de la colonne content de russian_tweets.
  • Joignez les colonnes following et followers comme métadonnées à tweet_corpus.
  • Affichez les premières lignes du tableau des métadonnées.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))

# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___

# Review the meta data
head(meta(___))
Modifier et exécuter le code