Un exemple d’échec en analyse de texte
Au début, vous avez vu l’intérêt de supprimer les mots vides avant de mener une analyse de texte. Dans ce chapitre, vous avez revu l’utilisation de la similarité cosinus pour repérer des textes qui se ressemblent.
Dans cet exercice, vous allez explorer un cas très réel d’échec lorsqu’on n’applique pas correctement l’analyse de texte. Vous allez calculer les similarités cosinus pour les chapitres du livre Animal Farm, sans supprimer les mots vides.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Passez en revue le code fourni pour créer les décomptes de mots. Cela a été fait pour vous.
- À l’aide de la fonction
pairwise_similarity()dewidyr, calculez les similarités cosinus pour chaque chapitre dans la colonnechapter. - Triez les résultats en plaçant d’abord les valeurs de
similarityles plus élevées. - Calculez la moyenne
meandes valeurs desimilarity.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create word counts
animal_farm_counts <- animal_farm %>%
unnest_tokens(word, text_column) %>%
count(chapter, word)
# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
___(___, ___, n) %>%
arrange(desc(___))
# Print the mean of the similarity values
comparisons %>%
summarize(mean = ___(___))