Zacznij terazZacznij za darmo

Porządek w danych

Wracamy do projektu analizy sentymentu na Twitterze! Istnieje kilka typów ciągów znaków, które utrudniają analizę sentymentu – i jednocześnie nie wnoszą do niej żadnej wartości. Należą do nich między innymi linki oraz wzmianki o użytkownikach.

Aby wyczyścić tweety, chcesz najpierw wyodrębnić kilka przykładów. Wiesz, że linki najczęściej zaczynają się od http i nie zawierają białych znaków, np. https://www.datacamp.com. Wzmianki o użytkownikach zaczynają się od @ i mogą zawierać wyłącznie litery oraz cyfry, np. @johnsmith3.

Zapisałeś kilka przydatnych kwantyfikatorów: * zero lub więcej razy, + jeden lub więcej razy, ? zero lub jeden raz.

Lista sentiment_analysis zawierająca tekst trzech tweetów jest już wczytana do twojej sesji. Możesz użyć funkcji print(), żeby wyświetlić dane w powłoce IPython.

To ćwiczenie jest częścią kursu

Wyrażenia regularne w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj moduł re.
  • Napisz wyrażenie regularne, które znajdzie wszystkie dopasowania linków http w każdym tweet z listy sentiment_analysis. Wyświetl wynik.
  • Napisz wyrażenie regularne, które znajdzie wszystkie dopasowania wzmianek o użytkownikach w każdym tweet z listy sentiment_analysis. Wyświetl wynik.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Edytuj i uruchom kod