ÎncepețiÎncepe gratuit

Totul curat

Înapoi la proiectul tău de analiză a sentimentelor pe Twitter! Există mai multe tipuri de șiruri de caractere care îți complică analiza sentimentelor, dar care nu oferă nicio informație utilă în acest sens. Printre acestea se numără linkurile și mențiunile de utilizatori.

Pentru a curăța tweet-urile, vrei mai întâi să extragi câteva exemple. Știi că, de cele mai multe ori, linkurile încep cu http și nu conțin spații, de exemplu https://www.datacamp.com. Mențiunile de utilizatori încep cu @ și pot conține doar litere și cifre, de exemplu @johnsmith3.

Ai notat câțiva cuantificatori utili: * de zero sau mai multe ori, + o dată sau mai mult, ? de zero sau o dată.

Lista sentiment_analysis, care conține textul a trei tweet-uri, este deja încărcată în sesiunea ta. Poți folosi print() pentru a vizualiza datele în Shell-ul IPython.

Acest exercițiu face parte din cursul

Expresii regulate în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă modulul re.
  • Scrie o expresie regulată pentru a găsi toate potrivirile linkurilor http care apar în fiecare tweet din sentiment_analysis. Afișează rezultatul.
  • Scrie o expresie regulată pentru a găsi toate potrivirile mențiunilor de utilizatori care apar în fiecare tweet din sentiment_analysis. Afișează rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import re module
____

for tweet in sentiment_analysis:
	# Write regex to match http links and print out result
	print(re.____(____"____", ____))

	# Write regex to match user mentions and print out result
	print(re.____(____"____", ____))
Editează și rulează codul