НачатьНачать бесплатно

Поиск совпадений и разбиение

Некоторые твиты в вашем наборе данных были загружены некорректно. Вместо пробелов для разделения слов в них оказались посторонние символы. Вы решаете использовать регулярные выражения, чтобы справиться с этой ситуацией. Для начала вы выводите несколько таких твитов, чтобы понять, какой шаблон нужно найти.

Вы замечаете, что предложения всегда разделены специальным символом, за которым следует число, слово break и ещё один специальный символ, например &4break!. Слова всегда разделены специальным символом, словом new и произвольным обычным символом, например #newH.

Переменная sentiment_analysis, содержащая текст одного твита, а также модуль re уже загружены в вашей сессии. Вы можете использовать print(sentiment_analysis), чтобы просмотреть её в оболочке IPython.

Это упражнение является частью курса

Регулярные выражения в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Write a regex to match pattern separating sentences
regex_sentence = ____"____"
Редактировать и запускать код