Tout est propre
Retour à votre projet d’analyse de sentiments sur Twitter ! Plusieurs types de chaînes augmentent la complexité de votre analyse, sans apporter d’information utile sur le sentiment. Parmi elles, on trouve les liens et les mentions d’utilisateur.
Pour nettoyer les tweets, vous souhaitez d’abord extraire quelques exemples. Vous savez que, la plupart du temps, les liens commencent par http et ne contiennent aucun espace, par ex. https://www.datacamp.com. Les mentions d’utilisateur commencent par @ et ne peuvent contenir que des lettres et des chiffres, par ex. @johnsmith3.
Vous notez quelques quantificateurs utiles : * zéro ou plusieurs fois, + une ou plusieurs fois, ? zéro ou une fois.
La liste sentiment_analysis contenant le texte de trois tweets est déjà chargée dans votre session. Vous pouvez utiliser print() pour afficher les données dans l’IPython Shell.
Cet exercice fait partie du cours
<cours>Expressions rationnelles en Python</cours>Instructions de l’exercice
- Importez le module
re. - Écrivez une regex pour trouver toutes les correspondances des liens
httpapparaissant dans chaquetweetdesentiment_analysis. Affichez le résultat. - Écrivez une regex pour trouver toutes les correspondances des mentions d’utilisateur apparaissant dans chaque
tweetdesentiment_analysis. Affichez le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))