or
Cette activité fait partie du cours
Le chapitre 1 d'Introduction au traitement automatique des langues vous prépare à exécuter votre première analyse de texte. Vous explorerez les expressions régulières et la tokenisation, deux des composantes les plus courantes de nombreuses tâches d'analyse. Avec les expressions régulières, vous pouvez rechercher pratiquement n'importe quel motif, et avec la tokenisation, vous pouvez préparer et nettoyer le texte pour une analyse plus poussée. Ce chapitre est indispensable pour aborder les techniques que nous verrons dans les autres chapitres du cours.
Dans ce chapitre, vous apprendrez les façons les plus répandues et étudiées d'analyser du texte. Vous verrez comment créer un corpus, transformer une représentation en sac de mots en matrice TF‑IDF, et utiliser des mesures de similarité cosinus pour déterminer à quel point deux textes se ressemblent. Vous consoliderez vos bases pour pratiquer le NLP avant d'aborder ses applications aux chapitres 3 et 4.
Exercice en cours
Le chapitre 3 met l'accent sur deux approches courantes d'analyse de texte : la modélisation de classification et la modélisation de sujets. Si vous travaillez sur des projets d'analyse de texte, vous utiliserez inévitablement l'une ou l'autre de ces méthodes, sinon les deux. Ce chapitre vous apprend à mettre en œuvre ces techniques et offre des pistes sur la façon de les aborder de manière pratique.
Au chapitre 4, nous couvrons deux incontournables du traitement automatique des langues : l'analyse de sentiment et les plongements de mots. Ce sont deux techniques d'analyse essentielles pour toute personne qui apprend les bases de l'analyse de texte. De plus, vous verrez brièvement BERT, l'étiquetage des parties du discours et la reconnaissance d'entités nommées. Près de 15 techniques d'analyse différentes sont abordées dans ce cours; le chapitre 4 se termine donc par un survol de tout ce que vous apprendrez au fil du cours.