CommencerCommencez gratuitement

Exercice sur TFIDF

Vous avez précédemment examiné une représentation en sac de mots d’articles sur le pétrole brut. Le calcul des valeurs TFIDF s’appuie sur cette représentation, mais tient compte à la fois de la fréquence d’apparition d’un mot dans un article et de sa fréquence dans l’ensemble des articles.

Pour évaluer la pertinence des mots lors de la comparaison d’articles différents, calculez les poids TFIDF pour les mots de crude, un corpus de 20 articles sur le pétrole brut.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Calculez les valeurs TFIDF pour crude par article_id et par word. Enregistrez le tibble obtenu sous le nom crude_weights.
  • Triez crude_weights avec la fonction arrange() par valeurs de tf_idf décroissantes.
  • Filtrez crude_weights pour obtenir les plus petites valeurs non nulles de tf_idf. Là encore, utilisez la fonction arrange.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
Modifier et exécuter le code