CommencezCommencez gratuitement

Tout nettoyer

Retour à votre projet d'analyse de sentiment sur Twitter! Il existe plusieurs types de chaînes qui compliquent votre analyse, sans apporter d'information utile. Parmi elles, on trouve les liens et les mentions d'utilisateurs.

Pour nettoyer les tweets, vous souhaitez d'abord en extraire quelques exemples. Vous savez que, la plupart du temps, les liens commencent par http et ne contiennent aucun espace, p. ex. https://www.datacamp.com. Les mentions d'utilisateurs commencent par @ et ne peuvent contenir que des lettres et des chiffres, p. ex. @johnsmith3.

Vous notez quelques quantificateurs utiles pour vous aider : * zéro ou plusieurs fois, + une ou plusieurs fois, ? zéro ou une fois.

La liste sentiment_analysis contenant le texte de trois tweets est déjà chargée dans votre session. Vous pouvez utiliser print() pour afficher les données dans l'IPython Shell.

Cette activité fait partie du cours

Expressions régulières en Python

Voir le cours

Instructions de l’exercice

  • Importez le module re.
  • Écrivez une expression rationnelle pour trouver toutes les correspondances des liens http apparaissant dans chaque tweet de sentiment_analysis. Affichez le résultat.
  • Écrivez une expression rationnelle pour trouver toutes les correspondances des mentions d'utilisateurs apparaissant dans chaque tweet de sentiment_analysis. Affichez le résultat.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Modifier et exécuter le code