ÎncepețiÎncepe gratuit

Înțelegerea diferenței

Trebuie să continui să lucrezi și să cureți setul de date cu tweet-uri. Observi că există câteva taguri HTML. Trebuie să le elimini, dar să păstrezi conținutul din interior, deoarece acesta este util pentru analiză.

Hai să analizăm această propoziție care conține un tag HTML:

I want to see that <strong>amazing show</strong> again!.

Știi că pentru a identifica tagul HTML trebuie să potrivești tot ce se află între parantezele unghiulare < >. Cea mai mare problemă este însă că tagul de închidere are aceeași structură. Dacă potrivești prea mult, vei sfârși prin a elimina informații esențiale. Prin urmare, trebuie să decizi dacă să folosești un cuantificator lacom sau unul leneș.

Șirul de caractere este deja încărcat ca string în sesiunea ta.

Acest exercițiu face parte din cursul

Expresii regulate în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă modulul re.
  • Scrie o expresie regex pentru a înlocui tagurile HTML cu un șir gol.
  • Afișează rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Editează și rulează codul