Exemple BoW
Dans les revues de littérature, les chercheurs lisent et résument autant de textes disponibles que possible sur un sujet. Il arrive qu’ils lisent des articles en double, ou des résumés d’articles qu’ils ont déjà lus. On vous a fourni 20 articles sur le pétrole brut sous la forme d’un objet R nommé crude_tibble. Plutôt que de vous lancer directement dans la lecture de chaque article, vous avez décidé d’examiner quels mots sont partagés entre ces articles. Pour cela, vous allez commencer par construire une représentation bag-of-words du texte.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Créez une représentation BoW en comptant le nombre de mots par article à l’aide de la colonne
article_id. - Utilisez le résultat pour déterminer combien de combinaisons article/mot uniques ont été créées.
- Filtrez les résultats pour les occurrences de
'prices'. - Combien d’articles contiennent le mot
prices?
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Count occurrence by article_id and word
words <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(___, ___, sort=TRUE)
# How many different word/article combinations are there?
unique_combinations <- nrow(___)
# Filter to responses with the word "prices"
words_with_prices <- words %>%
___(word == "___")
# How many articles had the word "prices"?
number_of_price_articles <- nrow(___)