CommencerCommencez gratuitement

Créer un tibble à partir d’un corpus

Pour approfondir l’exploration du corpus sur le pétrole brut que vous avez reçu d’un collègue, vous avez décidé de créer un pipeline pour nettoyer le texte contenu dans les documents. Plutôt que d’utiliser le package tm, vous avez choisi de transformer le corpus en tibble afin d’employer les fonctions unnest_tokens(), count() et anti_join() que vous maîtrisez déjà. Le corpus crude contient à la fois les métadonnées et le texte de chaque document.

Cet exercice fait partie du cours

<cours>Introduction au Natural Language Processing en R</cours>
Voir le cours

Instructions de l’exercice

  • Convertissez le corpus en tibble.
  • Utilisez names pour afficher les noms de colonnes.
  • Tokenisez (par mot), comptez et supprimez les mots vides à partir de la colonne text de crude_tibble.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
Modifier et exécuter le code