or
Cette activité fait partie du cours
Comme le texte est une donnée non structurée, un certain travail de préparation est nécessaire pour l'amener à une forme analysable. Dans ce chapitre, vous apprendrez à structurer un texte en le segmentant en unités (tokenisation), en le nettoyant et en le traitant comme une donnée catégorielle.
Les décomptes, c'est bien, mais les visualisations, c'est encore mieux. Dans ce chapitre, vous apprendrez à appliquer ce que vous connaissez de ggplot2 à des données textuelles au format « tidy ».
Même si les comptes de mots et les visualisations donnent un aperçu du contenu, on peut aller plus loin. Dans ce chapitre, nous dépassons les simples comptes de mots pour analyser le sentiment, ou la valence émotive, d'un texte.
Dans ce dernier chapitre, nous allons au-delà des comptes de mots pour mettre au jour les thèmes sous-jacents d'un ensemble de documents. Nous utiliserons un modèle thématique standard appelé allocation de Dirichlet latente.
Exercice en cours