CommencerCommencez gratuitement

Préparation des données

Lors de l’élection américaine de 2016, des robots Twitter russes ont été utilisés pour diffuser en continu des messages politiques auprès des démocrates comme des républicains. On vous a fourni un jeu de données contenant ces tweets, nommé russian_tweets. Vous avez décidé de classer ces tweets selon qu’ils penchent à gauche (démocrates) ou à droite (républicains). Avant de construire un modèle de classification, vous devez nettoyer et préparer le texte pour le modéliser.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Finalisez la tokenisation en appliquant le stemming aux jetons.
  • Utilisez cast_dtm() pour créer une matrice documents-termes.
  • Pesez la matrice documents-termes avec une pondération tf-idf.
  • Affichez la matrice.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
Modifier et exécuter le code