CommencezCommencez gratuitement

Comprendre la différence

Vous devez continuer à travailler et à nettoyer votre jeu de données de tweets. Vous vous rendez compte que certains marqueurs HTML sont présents. Vous devez les retirer, mais conserver leur contenu, car il est utile pour l'analyse.

Regardons cette phrase qui contient un marqueur HTML :

I want to see that <strong>amazing show</strong> again!.

Vous savez que, pour capter le marqueur HTML, vous devez faire correspondre tout ce qui se trouve entre chevrons < >. Mais le plus gros problème, c'est que le marqueur de fermeture a la même structure. Si vous faites une correspondance trop large, vous finirez par retirer des informations clés. Vous devez donc décider d'utiliser un quantificateur gourmand ou paresseux.

La chaîne de caractères est déjà chargée dans votre session sous le nom string.

Cette activité fait partie du cours

Expressions régulières en Python

Voir le cours

Instructions de l’exercice

  • Importez le module re.
  • Écrivez une expression regex pour remplacer les marqueurs HTML par une chaîne vide.
  • Affichez le résultat.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Modifier et exécuter le code