CommencezCommencez gratuitement

Aperçu express de l'exploration de texte

Il arrive qu'on puisse cerner l'intention de l'auteur et ses idées principales simplement en regardant les mots les plus fréquents.

Au fond, l'exploration de texte par sac de mots consiste à compter des termes, ou des n-grammes, dans un ensemble de documents. Considérez les phrases suivantes, que nous avons enregistrées dans text et mises à votre disposition dans votre espace de travail :

text <- "Text mining usually involves the process of structuring the input text. The overarching goal is, essentially, to turn text into data for analysis, via the application of natural language processing (NLP) and analytical methods."

Compter manuellement les mots dans les phrases ci‑dessus, c'est fastidieux ! Heureusement, le progiciel qdap offre une bien meilleure option. Vous pouvez facilement trouver les 4 termes les plus fréquents (ex æquo inclus) dans text en appelant la fonction freq_terms avec 4.

frequent_terms <- freq_terms(text, 4)

L'objet frequent_terms contient tous les mots uniques et leur nombre d'occurrences. Vous pouvez ensuite produire un diagramme à barres simplement en appelant la fonction plot sur l'objet frequent_terms.

plot(frequent_terms)

Cette activité fait partie du cours

Extraction de texte avec sac de mots en R

Voir le cours

Instructions de l’exercice

Nous avons créé dans votre espace de travail un objet nommé new_text contenant plusieurs phrases.

  • Chargez le progiciel qdap.
  • Affichez new_text dans la console.
  • Créez term_count avec les 10 termes les plus fréquents dans new_text.
  • Tracez un diagramme à barres avec les résultats de term_count.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load qdap
___

# Print new_text to the console
new_text

# Find the 10 most frequent terms: term_count
term_count <- ___

# Plot term_count
___
Modifier et exécuter le code