Rozdíl v praxi
Pokračuješ v čištění datasetu s tweety. Zjistíš, že některé tweety obsahují HTML tagy. Potřebuješ je odstranit, ale zachovat jejich obsah, protože ten se hodí pro analýzu.
Podívejme se na tuto větu s HTML tagem:
I want to see that <strong>amazing show</strong> again!.
Víš, že pro zachycení HTML tagu potřebuješ najít vše, co se nachází mezi hranatými závorkami < >. Největší problém ale spočívá v tom, že uzavírací tag má stejnou strukturu. Pokud zachytíš příliš mnoho, přijdeš o důležité informace. Proto si musíš rozmyslet, jestli použít chamtivý (greedy), nebo líný (lazy) kvantifikátor.
Řetězec je v tvé session již načtený jako string.
Toto cvičení je součástí kurzu
Regular Expressions in Python
Pokyny k cvičení
- Importuj modul
re. - Napiš výraz
regex, který nahradí HTML tagy prázdným řetězcem. - Vypiš výsledek.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____