Exercice sur TFIDF
Vous avez précédemment examiné une représentation en sac de mots d’articles sur le pétrole brut. Le calcul des valeurs TFIDF s’appuie sur cette représentation, mais tient compte à la fois de la fréquence d’apparition d’un mot dans un article et de sa fréquence dans l’ensemble des articles.
Pour évaluer la pertinence des mots lors de la comparaison d’articles différents, calculez les poids TFIDF pour les mots de crude, un corpus de 20 articles sur le pétrole brut.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Calculez les valeurs TFIDF pour
crudepararticle_idet parword. Enregistrez le tibble obtenu sous le nomcrude_weights. - Triez
crude_weightsavec la fonctionarrange()par valeurs detf_idfdécroissantes. - Filtrez
crude_weightspour obtenir les plus petites valeurs non nulles detf_idf. Là encore, utilisez la fonctionarrange.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)