Un exemple d'échec en analyse de texte
Au début, vous avez vu l'importance de retirer les mots vides avant de faire une analyse de texte. Dans le chapitre le plus récent, vous avez revu l'utilisation de la similarité cosinus pour repérer des textes qui se ressemblent.
Dans cet exercice, vous allez explorer une situation bien réelle : échouer à utiliser correctement l'analyse de texte. Vous allez calculer les similarités cosinus pour les chapitres du livre Animal Farm, sans retirer les mots vides.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Instructions de l’exercice
- Passez en revue le code fourni pour créer les décomptes de mots. Cela a déjà été fait pour vous.
- À l'aide de la fonction
pairwise_similarity()du paquetwidyr, calculez les similarités cosinus pour chaque chapitre dans la colonnechapter. - Triez les résultats en plaçant d'abord les valeurs les plus élevées de
similarity. - Calculez la moyenne (
mean) des valeurs desimilarity.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create word counts
animal_farm_counts <- animal_farm %>%
unnest_tokens(word, text_column) %>%
count(chapter, word)
# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
___(___, ___, n) %>%
arrange(desc(___))
# Print the mean of the similarity values
comparisons %>%
summarize(mean = ___(___))