CommencezCommencez gratuitement

Exemple BoW

Dans une recension des écrits, les chercheurs lisent et résument autant de textes pertinents que possible sur un sujet. Il arrive qu'ils lisent des articles en double ou des résumés d'articles qu'ils ont déjà consultés. On vous a fourni 20 articles sur le pétrole brut sous la forme d'un objet R nommé crude_tibble. Plutôt que de lire chaque article tout de suite, vous avez décidé d'examiner quels mots sont partagés entre ces articles. Pour ce faire, vous allez commencer par construire une représentation sac de mots (bag-of-words) du texte.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Créez une représentation BoW en comptant le nombre de mots par article à l'aide de la colonne article_id.
  • Utilisez le résultat pour déterminer combien de combinaisons article/mot uniques ont été créées.
  • Filtrez les résultats pour ne garder que les mentions de 'prices'.
  • Combien d'articles contiennent le mot prices ?

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Count occurrence by article_id and word
words <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(___, ___, sort=TRUE)

# How many different word/article combinations are there?
unique_combinations <- nrow(___)

# Filter to responses with the word "prices"
words_with_prices <- words %>%
  ___(word == "___")

# How many articles had the word "prices"?
number_of_price_articles <- nrow(___)
Modifier et exécuter le code