Поиск файлов
Вы не удовлетворены очисткой набора данных с твитами. В нём по-прежнему встречаются лишние строки, которые не несут никакой смысловой нагрузки для анализа тональности. Среди них — строки, содержащие названия текстовых файлов.
Вам удаётся найти закономерность для их обнаружения:
- Они появляются в начале строки.
- Они всегда начинаются с последовательности из 2 или 3 гласных букв в верхнем или нижнем регистре (a e i o u).
- Они всегда заканчиваются на
txt.
Вы пока не уверены, стоит ли удалять их сразу. Поэтому вы пишете скрипт, который находит такие строки и сохраняет их в отдельный набор данных.
Для работы вам понадобятся следующие метасимволы: ^ — привязка к началу строки, . — любой символ.
Переменная sentiment_analysis, содержащая текст двух твитов, а также модуль re уже загружены в вашу сессию. Вы можете использовать print(), чтобы просмотреть содержимое в командной оболочке IPython.
Это упражнение является частью курса
Регулярные выражения в Python
Инструкции к упражнению
- Напишите регулярное выражение, соответствующее шаблону названий текстовых файлов, например
aemyfile.txt. - Найдите все совпадения регулярного выражения в элементах
sentiment_analysis. Выведите результат на экран. - Замените все совпадения регулярного выражения на пустую строку
"". Выведите результат на экран.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))