ПочатиПочніть безкоштовно

Усе чисто

Повернімося до вашого проєкту аналізу тональності у Twitter! Є кілька типів рядків, які ускладнюють аналіз тональності, але не несуть корисної інформації. Серед них — посилання та згадки користувачів.

Щоб почистити твіти, спершу ви хочете витягнути кілька прикладів. Ви знаєте, що здебільшого посилання починаються з http і не містять пробілів, напр., https://www.datacamp.com. Згадки користувачів починаються з @ і можуть містити лише літери та цифри, напр., @johnsmith3.

Ви занотували корисні квантифікатори: * нуль або більше разів, + один або більше разів, ? нуль або один раз.

Список sentiment_analysis, що містить текст трьох твітів, уже завантажено у вашу сесію. Ви можете скористатися print(), щоб переглянути дані в оболонці IPython.

Ця вправа є частиною курсу

Regular Expressions in Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте модуль re.
  • Напишіть регулярний вираз, щоб знайти всі входження посилань, що починаються з http, у кожному tweet у sentiment_analysis. Виведіть результат.
  • Напишіть регулярний вираз, щоб знайти всі входження згадок користувачів у кожному tweet у sentiment_analysis. Виведіть результат.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Редагувати та запускати код