or
Cet exercice fait partie du cours
Le chapitre 1 d’Introduction au Natural Langauge Processing vous prépare à exécuter votre première analyse de texte. Vous explorerez les expressions régulières et la tokenisation, deux composants très courants dans la plupart des tâches d’analyse. Avec les expressions régulières, vous pouvez rechercher n’importe quel motif imaginé ; avec la tokenisation, vous préparez et nettoyez le texte pour des analyses plus poussées. Ce chapitre est indispensable pour aborder les techniques que nous verrons dans le reste du cours.
Dans ce chapitre, vous apprendrez les approches les plus courantes et étudiées pour analyser du texte. Vous verrez comment créer un corpus, étendre une représentation en sac de mots vers une matrice TF-IDF, et utiliser des mesures de similarité cosinus pour déterminer à quel point deux textes se ressemblent. Vous consoliderez vos bases pour pratiquer le NLP avant de plonger dans ses applications aux chapitres 3 et 4.
Le chapitre 3 se concentre sur deux approches classiques d’analyse de texte : la modélisation de classification et le topic modeling. Si vous travaillez sur des projets d’analyse de texte, vous utiliserez inévitablement l’une ou l’autre de ces méthodes. Ce chapitre vous apprend à mettre en œuvre ces deux techniques et vous donne des pistes pour les aborder de manière pratique.
Au chapitre 4, nous couvrons deux incontournables du Natural Language Processing : l’analyse de sentiments et les word embeddings. Ce sont deux techniques essentielles pour toute personne qui apprend les fondamentaux de l’analyse de texte. De plus, vous découvrirez brièvement BERT, l’étiquetage morphosyntaxique (part-of-speech tagging) et la reconnaissance d’entités nommées. Près de 15 techniques d’analyse différentes sont abordées dans ce cours ; le chapitre 4 se termine donc en récapitulant toutes les excellentes méthodes que vous allez découvrir.
Exercice actuel