Aan de slagBegin gratis

Het verschil begrijpen

Je gaat verder met het opschonen van je tweets-gegevensset. Je merkt dat er HTML-tags in voorkomen. Die wil je verwijderen, maar de inhoud ertussen behouden, omdat die nuttig is voor de analyse.

Kijk eens naar deze zin met een HTML-tag:

I want to see that <strong>amazing show</strong> again!.

Je weet dat je voor het vinden van de HTML-tag alles moet matchen wat tussen punthaken < > staat. Maar het grootste probleem is dat de sluittag dezelfde structuur heeft. Als je te veel matcht, verwijder je belangrijke informatie. Je moet dus kiezen tussen een gretige (greedy) of een luie (lazy) kwantor.

De string is al als string in je sessie geladen.

Deze oefening maakt deel uit van de cursus

Regular expressions in Python

Bekijk cursus

Oefeninstructies

  • Importeer de module re.
  • Schrijf een regex-expressie om HTML-tags te vervangen door een lege string.
  • Print het resultaat.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Code bewerken en uitvoeren