Kom igångKom igång gratis

Förstå skillnaden

Du behöver fortsätta bearbeta och rensa din tweet-datamängd. Du märker att det finns några HTML-taggar i texten. Du behöver ta bort dem men behålla innehållet inuti, eftersom det är användbart för analysen.

Ta en titt på den här meningen som innehåller en HTML-tagg:

I want to see that <strong>amazing show</strong> again!.

För att hitta HTML-taggen behöver du matcha allt som finns inuti vinkelparenteser < >. Det största problemet är att den avslutande taggen har samma struktur. Matchar du för mycket tar du bort viktig information. Du behöver alltså bestämma om du ska använda en girig eller en lat kvantifierare.

Strängen är redan inläst som string i din session.

Den här övningen är en del av kursen

Reguljära uttryck i Python

Visa kurs

Övningsinstruktioner

  • Importera modulen re.
  • Skriv ett regex-uttryck för att ersätta HTML-taggar med en tom sträng.
  • Skriv ut resultatet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Redigera och kör kod