CommencerCommencez gratuitement

Exemple BoW

Dans les revues de littérature, les chercheurs lisent et résument autant de textes disponibles que possible sur un sujet. Il arrive qu’ils lisent des articles en double, ou des résumés d’articles qu’ils ont déjà lus. On vous a fourni 20 articles sur le pétrole brut sous la forme d’un objet R nommé crude_tibble. Plutôt que de vous lancer directement dans la lecture de chaque article, vous avez décidé d’examiner quels mots sont partagés entre ces articles. Pour cela, vous allez commencer par construire une représentation bag-of-words du texte.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Créez une représentation BoW en comptant le nombre de mots par article à l’aide de la colonne article_id.
  • Utilisez le résultat pour déterminer combien de combinaisons article/mot uniques ont été créées.
  • Filtrez les résultats pour les occurrences de 'prices'.
  • Combien d’articles contiennent le mot prices ?

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Count occurrence by article_id and word
words <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(___, ___, sort=TRUE)

# How many different word/article combinations are there?
unique_combinations <- nrow(___)

# Filter to responses with the word "prices"
words_with_prices <- words %>%
  ___(word == "___")

# How many articles had the word "prices"?
number_of_price_articles <- nrow(___)
Modifier et exécuter le code