Créer un tibble à partir d'un corpus
Pour explorer plus à fond le corpus sur le pétrole brut que vous avez reçu d'un collègue, vous avez décidé de créer un enchaînement d'étapes pour nettoyer le texte contenu dans les documents. Plutôt que d'examiner comment faire avec le paquet tm, vous avez choisi de transformer le corpus en tibble afin de pouvoir utiliser les fonctions unnest_tokens(), count() et anti_join() que vous maîtrisez déjà. Le corpus crude contient à la fois les métadonnées et le texte de chaque document.
Cette activité fait partie du cours
Introduction au traitement automatique des langues en R
Instructions de l’exercice
- Convertissez le corpus en tibble.
- Utilisez
namespour afficher les noms de colonnes. - Faites la segmentation en tokens (par mot), comptez et retirez les mots vides de la colonne
textdecrude_tibble.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)