Créer un tibble à partir d’un corpus
Pour approfondir l’exploration du corpus sur le pétrole brut que vous avez reçu d’un collègue, vous avez décidé de créer un pipeline pour nettoyer le texte contenu dans les documents. Plutôt que d’utiliser le package tm, vous avez choisi de transformer le corpus en tibble afin d’employer les fonctions unnest_tokens(), count() et anti_join() que vous maîtrisez déjà. Le corpus crude contient à la fois les métadonnées et le texte de chaque document.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Instructions de l’exercice
- Convertissez le corpus en tibble.
- Utilisez
namespour afficher les noms de colonnes. - Tokenisez (par mot), comptez et supprimez les mots vides à partir de la colonne
textdecrude_tibble.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)