Obtenir des jetons
Votre prochaine étape consiste à tokeniser le texte de vos tweets. La tokenisation est le fait de découper une chaîne en unités lexicales ou, plus simplement, en mots. Mais avant cela, vous devez supprimer les hashtags pour ne pas fausser le processus. Vous remarquez que les hashtags commencent par le symbole # et contiennent des lettres et des chiffres, mais jamais d’espace. Ensuite, vous prévoyez de scinder le texte sur les correspondances d’espaces pour obtenir les jetons.
Vous avez sous la main votre liste de quantificateurs : * zéro ou plusieurs fois, + une ou plusieurs fois, ? zéro ou une fois, {n, m} minimum n, maximum m.
La variable sentiment_analysis, qui contient le texte d’un tweet, ainsi que le module re sont déjà chargés dans votre session. Vous pouvez utiliser print(sentiment_analysis) pour l’afficher dans l’IPython Shell.
Cet exercice fait partie du cours
<cours>Expressions rationnelles en Python</cours>Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Write a regex matching the hashtag pattern
regex = r"____"