Extraire des jetons
Votre prochaine étape consiste à tokeniser le texte de vos tweets. La tokenisation consiste à découper une chaîne en unités lexicales ou, plus simplement, en mots. Mais d'abord, vous devez retirer les mots-clics (hashtags) pour ne pas brouiller le processus. Vous remarquez que les hashtags commencent par le symbole # et contiennent des lettres et des chiffres, mais jamais d'espace blanc. Ensuite, vous prévoyez de scinder le texte sur les correspondances d'espaces blancs afin d'obtenir les jetons.
Vous avez sous la main votre liste de quantificateurs : * zéro ou plusieurs fois, + une ou plusieurs fois, ? zéro ou une fois, {n, m} minimum n, maximum m.
La variable sentiment_analysis contenant le texte d'un tweet, ainsi que le module re, sont déjà chargés dans votre session. Vous pouvez utiliser print(sentiment_analysis) pour l'afficher dans l'IPython Shell.
Cette activité fait partie du cours
Expressions régulières en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Write a regex matching the hashtag pattern
regex = r"____"