CommencezCommencez gratuitement

Créer un tibble à partir d'un corpus

Pour explorer plus à fond le corpus sur le pétrole brut que vous avez reçu d'un collègue, vous avez décidé de créer un enchaînement d'étapes pour nettoyer le texte contenu dans les documents. Plutôt que d'examiner comment faire avec le paquet tm, vous avez choisi de transformer le corpus en tibble afin de pouvoir utiliser les fonctions unnest_tokens(), count() et anti_join() que vous maîtrisez déjà. Le corpus crude contient à la fois les métadonnées et le texte de chaque document.

Cette activité fait partie du cours

Introduction au traitement automatique des langues en R

Voir le cours

Instructions de l’exercice

  • Convertissez le corpus en tibble.
  • Utilisez names pour afficher les noms de colonnes.
  • Faites la segmentation en tokens (par mot), comptez et retirez les mots vides de la colonne text de crude_tibble.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
Modifier et exécuter le code