ПочатиПочніть безкоштовно

Пошук файлів

Ви не задоволені очищенням свого набору даних із твітами. Досі трапляються зайві рядки, які не несуть жодного настрою. Серед них є рядки, що посилаються на назви текстових файлів.

Вам вдалося визначити, як їх виявляти:

  • Вони з'являються на початку рядка.
  • Завжди починаються з послідовності з 2 або 3 голосних у верхньому чи нижньому регістрі (a e i o u).
  • Завжди закінчуються суфіксом txt.

Ви не впевнені, чи варто видаляти їх одразу. Тому ви пишете скрипт, щоб знайти їх і зберегти в окремому наборі даних.

Ви занотували кілька метасимволів, які допоможуть: якір ^ для початку, . — будь-який символ.

Змінна sentiment_analysis, що містить текст двох твітів, а також модуль re уже завантажені у вашу сесію. Ви можете використати print(), щоб переглянути її в IPython Shell.

Ця вправа є частиною курсу

Regular Expressions in Python

Переглянути курс

Інструкції до вправи

  • Напишіть регулярний вираз, який відповідає шаблону назв текстових файлів, напр., aemyfile.txt.
  • Знайдіть усі збіги цього регулярного виразу в елементах sentiment_analysis. Виведіть результат.
  • Замініть усі збіги регулярного виразу на порожній рядок "". Виведіть результат.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
Редагувати та запускати код