CommencerCommencez gratuitement

Comprendre la différence

Vous devez continuer à travailler et à nettoyer votre jeu de données de tweets. Vous constatez que certains tags HTML sont présents. Vous devez les supprimer tout en conservant leur contenu interne, car il est utile pour l’analyse.

Examinons cette phrase contenant une balise HTML :

I want to see that <strong>amazing show</strong> again!.

Vous savez que pour récupérer une balise HTML, vous devez faire correspondre tout ce qui se trouve entre les chevrons < >. Mais le plus gros problème est que la balise fermante a la même structure. Si vous faites correspondre trop large, vous finirez par supprimer des informations clés. Vous devez donc décider d’utiliser un quantificateur gourmand ou fainéant.

La chaîne est déjà chargée dans votre session sous le nom string.

Cet exercice fait partie du cours

<cours>Expressions rationnelles en Python</cours>
Voir le cours

Instructions de l’exercice

  • Importez le module re.
  • Écrivez une expression regex pour remplacer les balises HTML par une chaîne vide.
  • Affichez le résultat.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Modifier et exécuter le code