НачатьНачать бесплатно

Получение токенов

Следующий шаг — токенизация текста твитов. Токенизация — это процесс разбиения строки на лексические единицы, или, проще говоря, на слова. Но сначала нужно удалить хэштеги, чтобы они не мешали дальнейшей обработке. Хэштеги начинаются с символа # и содержат буквы и цифры, но никогда — пробелы. После этого вы разобьёте текст по пробельным символам, чтобы получить токены.

Для удобства приведём список квантификаторов: * — ноль или более раз, + — один или более раз, ? — ноль или один раз, {n, m} — минимум n, максимум m.

Переменная sentiment_analysis с текстом одного твита и модуль re уже загружены в вашу сессию. Вы можете просмотреть содержимое с помощью print(sentiment_analysis) в IPython Shell.

Это упражнение является частью курса

Регулярные выражения в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Write a regex matching the hashtag pattern
regex = r"____"
Редактировать и запускать код