Tokenisation : phrases
Animal Farm est un livre souvent donné par les professeurs d’anglais au collège. Vous avez décidé d’explorer le texte et de fournir des statistiques descriptives que les enseignants pourront utiliser lorsqu’ils attribueront ce livre à leurs élèves. Vous savez déjà qu’il comporte 10 chapitres, mais vous savez aussi que la tokenisation peut vous aider à compter le nombre de phrases, de mots, et même de paragraphes. Dans cet exercice, vous allez utiliser les techniques de tokenisation vues dans la vidéo pour découper Animal Farm en phrases et les compter par chapitre.
Cet exercice fait partie du cours
<cours>Introduction au Natural Language Processing en R</cours>Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Split the text_column into sentences
animal_farm %>%
___(output = "sentences", input = text_column, token = ___)