Exercice sur le TFIDF
Plus tôt, vous avez examiné une représentation en sac de mots d'articles sur le pétrole brut. Le calcul des valeurs TFIDF s'appuie sur cette représentation, mais tient compte de la fréquence d'apparition d'un mot dans un article et de sa fréquence dans l'ensemble des articles.
Pour évaluer la pertinence des mots lors de la comparaison d'articles différents, calculez les pondérations TFIDF pour les mots de crude, un ensemble de 20 articles sur le pétrole brut.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Instructions de l’exercice
- Calculez les valeurs TFIDF pour
crudepararticle_idet parword. Enregistrez le tibble résultant sous le nomcrude_weights. - Triez
crude_weightsavec la fonctionarrange()par valeurs detf_idfdécroissantes. - Filtrez
crude_weightspour obtenir les plus petites valeurs detf_idfnon nulles. Utilisez encore la fonctionarrange.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)