Förstå skillnaden
Du behöver fortsätta bearbeta och rensa din tweet-datamängd. Du märker att det finns några HTML-taggar i texten. Du behöver ta bort dem men behålla innehållet inuti, eftersom det är användbart för analysen.
Ta en titt på den här meningen som innehåller en HTML-tagg:
I want to see that <strong>amazing show</strong> again!.
För att hitta HTML-taggen behöver du matcha allt som finns inuti vinkelparenteser < >. Det största problemet är att den avslutande taggen har samma struktur. Matchar du för mycket tar du bort viktig information. Du behöver alltså bestämma om du ska använda en girig eller en lat kvantifierare.
Strängen är redan inläst som string i din session.
Den här övningen är en del av kursen
Reguljära uttryck i Python
Övningsinstruktioner
- Importera modulen
re. - Skriv ett
regex-uttryck för att ersätta HTML-taggar med en tom sträng. - Skriv ut resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____