CommencerCommencez gratuitement

Matrices creuses

Dans la vidéo, vous avez découvert les matrices creuses. Elles peuvent devenir un vrai casse-tête informatique à mesure que le nombre de documents texte et le nombre de mots uniques augmentent. Créer des représentations de mots à partir de tweets produit facilement des matrices creuses, car on y trouve des émojis, de l’argot, des acronymes et d’autres formes de langage.

Dans cet exercice, vous allez suivre les étapes pour calculer à quel point le jeu de données de tweets russes est creux. Notez qu’il s’agit d’un petit exemple montrant à quelle vitesse l’analyse de texte peut devenir un problème informatique majeur.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
  ___(word, content) %>%
  ___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
  count(___)
Modifier et exécuter le code