CommencerCommencez gratuitement

Un exemple d’échec en analyse de texte

Au début, vous avez vu l’intérêt de supprimer les mots vides avant de mener une analyse de texte. Dans ce chapitre, vous avez revu l’utilisation de la similarité cosinus pour repérer des textes qui se ressemblent.

Dans cet exercice, vous allez explorer un cas très réel d’échec lorsqu’on n’applique pas correctement l’analyse de texte. Vous allez calculer les similarités cosinus pour les chapitres du livre Animal Farm, sans supprimer les mots vides.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Passez en revue le code fourni pour créer les décomptes de mots. Cela a été fait pour vous.
  • À l’aide de la fonction pairwise_similarity() de widyr, calculez les similarités cosinus pour chaque chapitre dans la colonne chapter.
  • Triez les résultats en plaçant d’abord les valeurs de similarity les plus élevées.
  • Calculez la moyenne mean des valeurs de similarity.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create word counts
animal_farm_counts <- animal_farm %>%
  unnest_tokens(word, text_column) %>%
  count(chapter, word)

# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
  ___(___, ___, n) %>%
  arrange(desc(___))

# Print the mean of the similarity values
comparisons %>%
  summarize(mean = ___(___))
Modifier et exécuter le code