Comprendre la différence
Vous devez continuer à travailler et à nettoyer votre jeu de données de tweets. Vous vous rendez compte que certains marqueurs HTML sont présents. Vous devez les retirer, mais conserver leur contenu, car il est utile pour l'analyse.
Regardons cette phrase qui contient un marqueur HTML :
I want to see that <strong>amazing show</strong> again!.
Vous savez que, pour capter le marqueur HTML, vous devez faire correspondre tout ce qui se trouve entre chevrons < >. Mais le plus gros problème, c'est que le marqueur de fermeture a la même structure. Si vous faites une correspondance trop large, vous finirez par retirer des informations clés. Vous devez donc décider d'utiliser un quantificateur gourmand ou paresseux.
La chaîne de caractères est déjà chargée dans votre session sous le nom string.
Cette activité fait partie du cours
Expressions régulières en Python
Instructions de l’exercice
- Importez le module
re. - Écrivez une expression
regexpour remplacer les marqueurs HTML par une chaîne vide. - Affichez le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____