Чисто и аккуратно
Вернёмся к проекту по анализу тональности твитов! Некоторые типы строк усложняют анализ тональности и при этом не несут никакой смысловой нагрузки. К таким строкам относятся ссылки и упоминания пользователей.
Чтобы очистить твиты, сначала нужно извлечь несколько примеров. Как правило, ссылки начинаются с http и не содержат пробелов — например, https://www.datacamp.com. Упоминания пользователей начинаются с @ и могут содержать только буквы и цифры — например, @johnsmith3.
Для удобства запишем полезные квантификаторы: * — ноль или более раз, + — один или более раз, ? — ноль или один раз.
Список sentiment_analysis, содержащий текст трёх твитов, уже загружен в вашу сессию. Используйте print(), чтобы просмотреть данные в оболочке IPython.
Это упражнение является частью курса
Регулярные выражения в Python
Инструкции к упражнению
- Импортируйте модуль
re. - Напишите регулярное выражение для поиска всех ссылок
httpв каждом твитеtweetиз спискаsentiment_analysis. Выведите результат на экран. - Напишите регулярное выражение для поиска всех упоминаний пользователей в каждом твите
tweetиз спискаsentiment_analysis. Выведите результат на экран.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))