Préparation des données
Lors de l’élection américaine de 2016, des robots Twitter russes ont été utilisés pour diffuser en continu des messages politiques auprès des démocrates comme des républicains. On vous a fourni un jeu de données contenant ces tweets, nommé russian_tweets. Vous avez décidé de classer ces tweets selon qu’ils penchent à gauche (démocrates) ou à droite (républicains). Avant de construire un modèle de classification, vous devez nettoyer et préparer le texte pour le modéliser.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Finalisez la tokenisation en appliquant le stemming aux jetons.
- Utilisez
cast_dtm()pour créer une matrice documents-termes. - Pesez la matrice documents-termes avec une pondération tf-idf.
- Affichez la matrice.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Stem the tokens
russian_tokens <- russian_tweets %>%
unnest_tokens(output = "word", token = "words", input = content) %>%
anti_join(stop_words) %>%
___(word = ___(word))
# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
count(tweet_id, word) %>%
___(document = ___, term = ___,
value = n, weighting = tm::___)
# Print the matrix details
___