Tout nettoyer
Retour à votre projet d'analyse de sentiment sur Twitter! Il existe plusieurs types de chaînes qui compliquent votre analyse, sans apporter d'information utile. Parmi elles, on trouve les liens et les mentions d'utilisateurs.
Pour nettoyer les tweets, vous souhaitez d'abord en extraire quelques exemples. Vous savez que, la plupart du temps, les liens commencent par http et ne contiennent aucun espace, p. ex. https://www.datacamp.com. Les mentions d'utilisateurs commencent par @ et ne peuvent contenir que des lettres et des chiffres, p. ex. @johnsmith3.
Vous notez quelques quantificateurs utiles pour vous aider : * zéro ou plusieurs fois, + une ou plusieurs fois, ? zéro ou une fois.
La liste sentiment_analysis contenant le texte de trois tweets est déjà chargée dans votre session. Vous pouvez utiliser print() pour afficher les données dans l'IPython Shell.
Cette activité fait partie du cours
Expressions régulières en Python
Instructions de l’exercice
- Importez le module
re. - Écrivez une expression rationnelle pour trouver toutes les correspondances des liens
httpapparaissant dans chaquetweetdesentiment_analysis. Affichez le résultat. - Écrivez une expression rationnelle pour trouver toutes les correspondances des mentions d'utilisateurs apparaissant dans chaque
tweetdesentiment_analysis. Affichez le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))