Créer un corpus
Vous avez créé un tibble nommé russian_tweets qui contient environ 20 000 gazouillis générés automatiquement par des robots durant le cycle électoral américain de 2016 afin d'effectuer une analyse de texte. Toutefois, après avoir examiné les options disponibles pour réaliser l'analyse que vous avez choisie, vous pensez que le paquet tm est la voie la plus simple. Pour mener l'analyse, vous devez d'abord créer un corpus et y joindre des métadonnées potentiellement utiles.
Soyez conscient qu'il s'agit de véritables données de Twitter et qu'il y a donc toujours un risque qu'elles contiennent des grossièretés ou d'autres contenus offensants (dans cet exercice et dans tout exercice ultérieur utilisant aussi de vraies données de Twitter).
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Instructions de l’exercice
- Créez un corpus à partir de la colonne
contentderussian_tweets. - Joignez les colonnes
followingetfollowerscomme métadonnées àtweet_corpus. - Affichez les premières lignes du tableau des métadonnées.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))
# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___
# Review the meta data
head(meta(___))