НачатьНачать бесплатно

Чисто и аккуратно

Вернёмся к проекту по анализу тональности твитов! Некоторые типы строк усложняют анализ тональности и при этом не несут никакой смысловой нагрузки. К таким строкам относятся ссылки и упоминания пользователей.

Чтобы очистить твиты, сначала нужно извлечь несколько примеров. Как правило, ссылки начинаются с http и не содержат пробелов — например, https://www.datacamp.com. Упоминания пользователей начинаются с @ и могут содержать только буквы и цифры — например, @johnsmith3.

Для удобства запишем полезные квантификаторы: * — ноль или более раз, + — один или более раз, ? — ноль или один раз.

Список sentiment_analysis, содержащий текст трёх твитов, уже загружен в вашу сессию. Используйте print(), чтобы просмотреть данные в оболочке IPython.

Это упражнение является частью курса

Регулярные выражения в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте модуль re.
  • Напишите регулярное выражение для поиска всех ссылок http в каждом твите tweet из списка sentiment_analysis. Выведите результат на экран.
  • Напишите регулярное выражение для поиска всех упоминаний пользователей в каждом твите tweet из списка sentiment_analysis. Выведите результат на экран.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Редактировать и запускать код