Усе чисто
Повернімося до вашого проєкту аналізу тональності у Twitter! Є кілька типів рядків, які ускладнюють аналіз тональності, але не несуть корисної інформації. Серед них — посилання та згадки користувачів.
Щоб почистити твіти, спершу ви хочете витягнути кілька прикладів. Ви знаєте, що здебільшого посилання починаються з http і не містять пробілів, напр., https://www.datacamp.com. Згадки користувачів починаються з @ і можуть містити лише літери та цифри, напр., @johnsmith3.
Ви занотували корисні квантифікатори: * нуль або більше разів, + один або більше разів, ? нуль або один раз.
Список sentiment_analysis, що містить текст трьох твітів, уже завантажено у вашу сесію. Ви можете скористатися print(), щоб переглянути дані в оболонці IPython.
Ця вправа є частиною курсу
Regular Expressions in Python
Інструкції до вправи
- Імпортуйте модуль
re. - Напишіть регулярний вираз, щоб знайти всі входження посилань, що починаються з
http, у кожномуtweetуsentiment_analysis. Виведіть результат. - Напишіть регулярний вираз, щоб знайти всі входження згадок користувачів у кожному
tweetуsentiment_analysis. Виведіть результат.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))