НачатьНачать бесплатно

Поиск файлов

Вы не удовлетворены очисткой набора данных с твитами. В нём по-прежнему встречаются лишние строки, которые не несут никакой смысловой нагрузки для анализа тональности. Среди них — строки, содержащие названия текстовых файлов.

Вам удаётся найти закономерность для их обнаружения:

  • Они появляются в начале строки.
  • Они всегда начинаются с последовательности из 2 или 3 гласных букв в верхнем или нижнем регистре (a e i o u).
  • Они всегда заканчиваются на txt.

Вы пока не уверены, стоит ли удалять их сразу. Поэтому вы пишете скрипт, который находит такие строки и сохраняет их в отдельный набор данных.

Для работы вам понадобятся следующие метасимволы: ^ — привязка к началу строки, . — любой символ.

Переменная sentiment_analysis, содержащая текст двух твитов, а также модуль re уже загружены в вашу сессию. Вы можете использовать print(), чтобы просмотреть содержимое в командной оболочке IPython.

Это упражнение является частью курса

Регулярные выражения в Python

Посмотреть курс

Инструкции к упражнению

  • Напишите регулярное выражение, соответствующее шаблону названий текстовых файлов, например aemyfile.txt.
  • Найдите все совпадения регулярного выражения в элементах sentiment_analysis. Выведите результат на экран.
  • Замените все совпадения регулярного выражения на пустую строку "". Выведите результат на экран.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Редактировать и запускать код