Поиск совпадений и разбиение
Некоторые твиты в вашем наборе данных были загружены некорректно. Вместо пробелов для разделения слов в них оказались посторонние символы. Вы решаете использовать регулярные выражения, чтобы справиться с этой ситуацией. Для начала вы выводите несколько таких твитов, чтобы понять, какой шаблон нужно найти.
Вы замечаете, что предложения всегда разделены специальным символом, за которым следует число, слово break и ещё один специальный символ, например &4break!. Слова всегда разделены специальным символом, словом new и произвольным обычным символом, например #newH.
Переменная sentiment_analysis, содержащая текст одного твита, а также модуль re уже загружены в вашей сессии. Вы можете использовать print(sentiment_analysis), чтобы просмотреть её в оболочке IPython.
Это упражнение является частью курса
Регулярные выражения в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Write a regex to match pattern separating sentences
regex_sentence = ____"____"