Préparation des données
Lors de l'élection américaine de 2016, des robots de clavardage russes ont diffusé en continu des messages politiques destinés aux démocrates comme aux républicains. On vous a fourni un jeu de données de ces tweets appelé russian_tweets. Vous avez décidé de classer ces tweets comme étant d'orientation de gauche (démocrate) ou de droite (républicain). Avant de pouvoir construire un modèle de classification, vous devez nettoyer et préparer le texte pour la modélisation.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Instructions de l’exercice
- Finalisez la tokenisation en appliquant la racinisation aux jetons.
- Utilisez
cast_dtm()pour créer une matrice documents-termes. - Appliquez une pondération tf-idf à la matrice documents-termes.
- Affichez la matrice.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Stem the tokens
russian_tokens <- russian_tweets %>%
unnest_tokens(output = "word", token = "words", input = content) %>%
anti_join(stop_words) %>%
___(word = ___(word))
# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
count(tweet_id, word) %>%
___(document = ___, term = ___,
value = n, weighting = tm::___)
# Print the matrix details
___