Zacznij terazZacznij za darmo

Różnica między zachłannym a leniwym dopasowaniem

Musisz kontynuować czyszczenie zbioru danych z tweetami. Okazuje się, że niektóre tweety zawierają tagi HTML. Trzeba je usunąć, zachowując jednak treść wewnątrz – jest ona potrzebna do analizy.

Przyjrzyj się temu zdaniu z tagiem HTML:

I want to see that <strong>amazing show</strong> again!.

Wiesz, że aby dopasować tag HTML, musisz znaleźć wszystko, co znajduje się wewnątrz nawiasów ostrych < >. Największy problem polega na tym, że tag zamykający ma tę samą strukturę. Jeśli dopasowanie będzie zbyt szerokie, usuniesz ważne informacje. Musisz więc zdecydować, czy użyć zachłannego, czy leniwego kwantyfikatora.

Zmienna string jest już załadowana do twojej sesji.

To ćwiczenie jest częścią kursu

Wyrażenia regularne w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj moduł re.
  • Napisz wyrażenie regex, które zastąpi tagi HTML pustym ciągiem znaków.
  • Wydrukuj wynik.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Edytuj i uruchom kod