Matrices creuses
Dans la vidéo, vous avez appris ce que sont les matrices creuses. Elles peuvent devenir un véritable casse-tête informatique à mesure que le nombre de documents textuels et le nombre de mots uniques augmentent. Créer des représentations de mots à partir de tweets produit facilement des matrices creuses, parce qu'on y retrouve des émojis, de l'argot, des acronymes et d'autres formes de langage.
Dans cet exercice, vous allez suivre les étapes pour calculer à quel point l'ensemble de tweets russes est creux. Notez qu'il s'agit d'un petit exemple montrant à quelle vitesse l'analyse de texte peut devenir un enjeu informatique majeur.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
___(word, content) %>%
___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
count(___)