Отримання токенів
Ваш наступний крок — токенізувати текст твітів. Токенізація — це процес поділу рядка на лексичні одиниці або, простіше кажучи, слова. Але спочатку потрібно прибрати гештеги, щоб вони не заважали обробці. Ви знаєте, що гештеги починаються із символу # і містять літери та цифри, але ніколи не містять пробілів. Після цього ви плануєте розбити текст за збігами пробілів, щоб отримати токени.
Використайте свій список квантифікаторів: * — нуль або більше разів, + — один або більше разів, ? — нуль або один раз, {n, m} — мінімум n, максимум m.
Змінна sentiment_analysis, що містить текст одного твіту, а також модуль re уже завантажені у вашу сесію. Ви можете скористатися print(sentiment_analysis), щоб переглянути його в IPython Shell.
Ця вправа є частиною курсу
Regular Expressions in Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Write a regex matching the hashtag pattern
regex = r"____"