CommencezCommencez gratuitement

Préparation des données

Lors de l'élection américaine de 2016, des robots de clavardage russes ont diffusé en continu des messages politiques destinés aux démocrates comme aux républicains. On vous a fourni un jeu de données de ces tweets appelé russian_tweets. Vous avez décidé de classer ces tweets comme étant d'orientation de gauche (démocrate) ou de droite (républicain). Avant de pouvoir construire un modèle de classification, vous devez nettoyer et préparer le texte pour la modélisation.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Finalisez la tokenisation en appliquant la racinisation aux jetons.
  • Utilisez cast_dtm() pour créer une matrice documents-termes.
  • Appliquez une pondération tf-idf à la matrice documents-termes.
  • Affichez la matrice.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
Modifier et exécuter le code