Začněte nyníZačněte zdarma

Rozdíl v praxi

Pokračuješ v čištění datasetu s tweety. Zjistíš, že některé tweety obsahují HTML tagy. Potřebuješ je odstranit, ale zachovat jejich obsah, protože ten se hodí pro analýzu.

Podívejme se na tuto větu s HTML tagem:

I want to see that <strong>amazing show</strong> again!.

Víš, že pro zachycení HTML tagu potřebuješ najít vše, co se nachází mezi hranatými závorkami < >. Největší problém ale spočívá v tom, že uzavírací tag má stejnou strukturu. Pokud zachytíš příliš mnoho, přijdeš o důležité informace. Proto si musíš rozmyslet, jestli použít chamtivý (greedy), nebo líný (lazy) kvantifikátor.

Řetězec je v tvé session již načtený jako string.

Toto cvičení je součástí kurzu

Regular Expressions in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj modul re.
  • Napiš výraz regex, který nahradí HTML tagy prázdným řetězcem.
  • Vypiš výsledek.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Upravit a spustit kód