CommencerCommencez gratuitement

Tout est propre

Retour à votre projet d’analyse de sentiments sur Twitter ! Plusieurs types de chaînes augmentent la complexité de votre analyse, sans apporter d’information utile sur le sentiment. Parmi elles, on trouve les liens et les mentions d’utilisateur.

Pour nettoyer les tweets, vous souhaitez d’abord extraire quelques exemples. Vous savez que, la plupart du temps, les liens commencent par http et ne contiennent aucun espace, par ex. https://www.datacamp.com. Les mentions d’utilisateur commencent par @ et ne peuvent contenir que des lettres et des chiffres, par ex. @johnsmith3.

Vous notez quelques quantificateurs utiles : * zéro ou plusieurs fois, + une ou plusieurs fois, ? zéro ou une fois.

La liste sentiment_analysis contenant le texte de trois tweets est déjà chargée dans votre session. Vous pouvez utiliser print() pour afficher les données dans l’IPython Shell.

Cet exercice fait partie du cours

<cours>Expressions rationnelles en Python</cours>
Voir le cours

Instructions de l’exercice

  • Importez le module re.
  • Écrivez une regex pour trouver toutes les correspondances des liens http apparaissant dans chaque tweet de sentiment_analysis. Affichez le résultat.
  • Écrivez une regex pour trouver toutes les correspondances des mentions d’utilisateur apparaissant dans chaque tweet de sentiment_analysis. Affichez le résultat.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Modifier et exécuter le code