Получение токенов
Следующий шаг — токенизация текста твитов. Токенизация — это процесс разбиения строки на лексические единицы, или, проще говоря, на слова. Но сначала нужно удалить хэштеги, чтобы они не мешали дальнейшей обработке. Хэштеги начинаются с символа # и содержат буквы и цифры, но никогда — пробелы. После этого вы разобьёте текст по пробельным символам, чтобы получить токены.
Для удобства приведём список квантификаторов: * — ноль или более раз, + — один или более раз, ? — ноль или один раз, {n, m} — минимум n, максимум m.
Переменная sentiment_analysis с текстом одного твита и модуль re уже загружены в вашу сессию. Вы можете просмотреть содержимое с помощью print(sentiment_analysis) в IPython Shell.
Это упражнение является частью курса
Регулярные выражения в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Write a regex matching the hashtag pattern
regex = r"____"