Faire correspondre et fractionner
Certains tweets de votre jeu de données ont été téléchargés incorrectement. Au lieu d'avoir des espaces pour séparer les mots, ils contiennent des caractères étranges. Vous décidez d'utiliser des expressions régulières pour gérer cette situation. Vous affichez quelques-uns de ces tweets afin de comprendre quel motif vous devez faire correspondre.
Vous remarquez que les phrases sont toujours séparées par un caractère spécial, suivi d'un chiffre, du mot break, puis d'un autre caractère spécial, p. ex. &4break!. Les mots sont toujours séparés par un caractère spécial, le mot new, puis un caractère normal aléatoire, p. ex. #newH.
La variable sentiment_analysis qui contient le texte d'un tweet, ainsi que le module re, ont déjà été chargés dans votre session. Vous pouvez utiliser print(sentiment_analysis) pour l'afficher dans l'IPython Shell.
Cette activité fait partie du cours
Expressions régulières en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Write a regex to match pattern separating sentences
regex_sentence = ____"____"