НачатьНачать бесплатно

Разница между жадными и ленивыми квантификаторами

Вы продолжаете работать с набором данных твитов и очищать его. Вы замечаете, что в текстах встречаются HTML-теги. Их нужно удалить, но при этом сохранить содержимое внутри — оно важно для анализа.

Рассмотрим следующее предложение с HTML-тегом:

I want to see that <strong>amazing show</strong> again!.

Чтобы найти HTML-теги, нужно сопоставить всё, что находится внутри угловых скобок < >. Однако сложность в том, что закрывающий тег имеет ту же структуру. Если захватить слишком много, можно удалить нужную информацию. Поэтому важно решить: использовать жадный или ленивый квантификатор?

Строка уже загружена в вашу сессию как string.

Это упражнение является частью курса

Регулярные выражения в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте модуль re.
  • Напишите регулярное выражение regex, которое заменяет HTML-теги на пустую строку.
  • Выведите результат на экран.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
Редактировать и запускать код