Разница между жадными и ленивыми квантификаторами
Вы продолжаете работать с набором данных твитов и очищать его. Вы замечаете, что в текстах встречаются HTML-теги. Их нужно удалить, но при этом сохранить содержимое внутри — оно важно для анализа.
Рассмотрим следующее предложение с HTML-тегом:
I want to see that <strong>amazing show</strong> again!.
Чтобы найти HTML-теги, нужно сопоставить всё, что находится внутри угловых скобок < >. Однако сложность в том, что закрывающий тег имеет ту же структуру. Если захватить слишком много, можно удалить нужную информацию. Поэтому важно решить: использовать жадный или ленивый квантификатор?
Строка уже загружена в вашу сессию как string.
Это упражнение является частью курса
Регулярные выражения в Python
Инструкции к упражнению
- Импортируйте модуль
re. - Напишите регулярное выражение
regex, которое заменяет HTML-теги на пустую строку. - Выведите результат на экран.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____