CommencezCommencez gratuitement

Exercice sur le TFIDF

Plus tôt, vous avez examiné une représentation en sac de mots d'articles sur le pétrole brut. Le calcul des valeurs TFIDF s'appuie sur cette représentation, mais tient compte de la fréquence d'apparition d'un mot dans un article et de sa fréquence dans l'ensemble des articles.

Pour évaluer la pertinence des mots lors de la comparaison d'articles différents, calculez les pondérations TFIDF pour les mots de crude, un ensemble de 20 articles sur le pétrole brut.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Calculez les valeurs TFIDF pour crude par article_id et par word. Enregistrez le tibble résultant sous le nom crude_weights.
  • Triez crude_weights avec la fonction arrange() par valeurs de tf_idf décroissantes.
  • Filtrez crude_weights pour obtenir les plus petites valeurs de tf_idf non nulles. Utilisez encore la fonction arrange.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
Modifier et exécuter le code