Matrices creuses
Dans la vidéo, vous avez découvert les matrices creuses. Elles peuvent devenir un vrai casse-tête informatique à mesure que le nombre de documents texte et le nombre de mots uniques augmentent. Créer des représentations de mots à partir de tweets produit facilement des matrices creuses, car on y trouve des émojis, de l’argot, des acronymes et d’autres formes de langage.
Dans cet exercice, vous allez suivre les étapes pour calculer à quel point le jeu de données de tweets russes est creux. Notez qu’il s’agit d’un petit exemple montrant à quelle vitesse l’analyse de texte peut devenir un problème informatique majeur.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Tokenize and remove stop words
tidy_tweets <- russian_tweets %>%
___(word, content) %>%
___(stop_words)
# Count by word
unique_words <- tidy_tweets %>%
count(___)