CommencezCommencez gratuitement

Un exemple d'échec en analyse de texte

Au début, vous avez vu l'importance de retirer les mots vides avant de faire une analyse de texte. Dans le chapitre le plus récent, vous avez revu l'utilisation de la similarité cosinus pour repérer des textes qui se ressemblent.

Dans cet exercice, vous allez explorer une situation bien réelle : échouer à utiliser correctement l'analyse de texte. Vous allez calculer les similarités cosinus pour les chapitres du livre Animal Farm, sans retirer les mots vides.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Passez en revue le code fourni pour créer les décomptes de mots. Cela a déjà été fait pour vous.
  • À l'aide de la fonction pairwise_similarity() du paquet widyr, calculez les similarités cosinus pour chaque chapitre dans la colonne chapter.
  • Triez les résultats en plaçant d'abord les valeurs les plus élevées de similarity.
  • Calculez la moyenne (mean) des valeurs de similarity.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create word counts
animal_farm_counts <- animal_farm %>%
  unnest_tokens(word, text_column) %>%
  count(chapter, word)

# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
  ___(___, ___, n) %>%
  arrange(desc(___))

# Print the mean of the similarity values
comparisons %>%
  summarize(mean = ___(___))
Modifier et exécuter le code