CommencezCommencez gratuitement

Extraire des jetons

Votre prochaine étape consiste à tokeniser le texte de vos tweets. La tokenisation consiste à découper une chaîne en unités lexicales ou, plus simplement, en mots. Mais d'abord, vous devez retirer les mots-clics (hashtags) pour ne pas brouiller le processus. Vous remarquez que les hashtags commencent par le symbole # et contiennent des lettres et des chiffres, mais jamais d'espace blanc. Ensuite, vous prévoyez de scinder le texte sur les correspondances d'espaces blancs afin d'obtenir les jetons.

Vous avez sous la main votre liste de quantificateurs : * zéro ou plusieurs fois, + une ou plusieurs fois, ? zéro ou une fois, {n, m} minimum n, maximum m.

La variable sentiment_analysis contenant le texte d'un tweet, ainsi que le module re, sont déjà chargés dans votre session. Vous pouvez utiliser print(sentiment_analysis) pour l'afficher dans l'IPython Shell.

Cette activité fait partie du cours

Expressions régulières en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Write a regex matching the hashtag pattern
regex = r"____"
Modifier et exécuter le code