Пошук файлів
Ви не задоволені очищенням свого набору даних із твітами. Досі трапляються зайві рядки, які не несуть жодного настрою. Серед них є рядки, що посилаються на назви текстових файлів.
Вам вдалося визначити, як їх виявляти:
- Вони з'являються на початку рядка.
- Завжди починаються з послідовності з 2 або 3 голосних у верхньому чи нижньому регістрі (a e i o u).
- Завжди закінчуються суфіксом
txt.
Ви не впевнені, чи варто видаляти їх одразу. Тому ви пишете скрипт, щоб знайти їх і зберегти в окремому наборі даних.
Ви занотували кілька метасимволів, які допоможуть: якір ^ для початку, . — будь-який символ.
Змінна sentiment_analysis, що містить текст двох твітів, а також модуль re уже завантажені у вашу сесію. Ви можете використати print(), щоб переглянути її в IPython Shell.
Ця вправа є частиною курсу
Regular Expressions in Python
Інструкції до вправи
- Напишіть регулярний вираз, який відповідає шаблону назв текстових файлів, напр.,
aemyfile.txt. - Знайдіть усі збіги цього регулярного виразу в елементах
sentiment_analysis. Виведіть результат. - Замініть усі збіги регулярного виразу на порожній рядок
"". Виведіть результат.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))