CommencezCommencez gratuitement

Matrices creuses

Dans la vidéo, vous avez appris ce que sont les matrices creuses. Elles peuvent devenir un véritable casse-tête informatique à mesure que le nombre de documents textuels et le nombre de mots uniques augmentent. Créer des représentations de mots à partir de tweets produit facilement des matrices creuses, parce qu'on y retrouve des émojis, de l'argot, des acronymes et d'autres formes de langage.

Dans cet exercice, vous allez suivre les étapes pour calculer à quel point l'ensemble de tweets russes est creux. Notez qu'il s'agit d'un petit exemple montrant à quelle vitesse l'analyse de texte peut devenir un enjeu informatique majeur.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
  ___(word, content) %>%
  ___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
  count(___)
Modifier et exécuter le code