Het verschil begrijpen
Je gaat verder met het opschonen van je tweets-gegevensset. Je merkt dat er HTML-tags in voorkomen. Die wil je verwijderen, maar de inhoud ertussen behouden, omdat die nuttig is voor de analyse.
Kijk eens naar deze zin met een HTML-tag:
I want to see that <strong>amazing show</strong> again!.
Je weet dat je voor het vinden van de HTML-tag alles moet matchen wat tussen punthaken < > staat. Maar het grootste probleem is dat de sluittag dezelfde structuur heeft. Als je te veel matcht, verwijder je belangrijke informatie. Je moet dus kiezen tussen een gretige (greedy) of een luie (lazy) kwantor.
De string is al als string in je sessie geladen.
Deze oefening maakt deel uit van de cursus
Regular expressions in Python
Oefeninstructies
- Importeer de module
re. - Schrijf een
regex-expressie om HTML-tags te vervangen door een lege string. - Print het resultaat.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____