Розуміння відмінності
Вам потрібно продовжити опрацьовувати й очищати набір даних з твітами. Ви помічаєте, що в ньому є HTML-теги. Їх треба видалити, але залишити вміст усередині — він корисний для аналізу.
Розгляньмо це речення з HTML‑тегом:
I want to see that <strong>amazing show</strong> again!.
Ви знаєте, що щоб знайти HTML‑тег, треба зіставити все, що стоїть у кутових дужках < >. Але найбільша проблема в тому, що закривальний тег має таку саму структуру. Якщо збіг буде надто жадібним, ви видалите важливу інформацію. Тож потрібно вирішити, чи використовувати жадібний, чи «ледачий» квантифікатор.
Рядок уже завантажено у вашу сесію як string.
Ця вправа є частиною курсу
Regular Expressions in Python
Інструкції до вправи
- Імпортуйте модуль
re. - Напишіть вираз
regex, щоб замінити HTML‑теги на порожній рядок. - Виведіть результат.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____