Créer un corpus
Vous avez créé un tibble appelé russian_tweets qui contient environ 20 000 tweets générés automatiquement par des bots pendant l’élection américaine de 2016, afin de pouvoir réaliser une analyse de texte. Cependant, en passant en revue les options disponibles pour mener l’analyse que vous avez choisie, vous pensez que le package tm offre la voie la plus simple. Pour conduire l’analyse, vous devez d’abord créer un corpus et y associer des métadonnées potentiellement utiles.
Sachez qu’il s’agit de données réelles provenant de Twitter ; il existe donc un risque qu’elles contiennent des grossièretés ou d’autres contenus offensants (dans cet exercice et dans tout exercice ultérieur utilisant également de vraies données Twitter).
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Créez un corpus en utilisant la colonne
contentderussian_tweets. - Ajoutez les colonnes
followingetfollowerscomme métadonnées àtweet_corpus. - Affichez les premières lignes du tableau des métadonnées.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))
# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___
# Review the meta data
head(meta(___))