Înțelegerea diferenței
Trebuie să continui să lucrezi și să cureți setul de date cu tweet-uri. Observi că există câteva taguri HTML. Trebuie să le elimini, dar să păstrezi conținutul din interior, deoarece acesta este util pentru analiză.
Hai să analizăm această propoziție care conține un tag HTML:
I want to see that <strong>amazing show</strong> again!.
Știi că pentru a identifica tagul HTML trebuie să potrivești tot ce se află între parantezele unghiulare < >. Cea mai mare problemă este însă că tagul de închidere are aceeași structură. Dacă potrivești prea mult, vei sfârși prin a elimina informații esențiale. Prin urmare, trebuie să decizi dacă să folosești un cuantificator lacom sau unul leneș.
Șirul de caractere este deja încărcat ca string în sesiunea ta.
Acest exercițiu face parte din cursul
Expresii regulate în Python
Instrucțiuni pentru exercițiu
- Importă modulul
re. - Scrie o expresie
regexpentru a înlocui tagurile HTML cu un șir gol. - Afișează rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____