Totul curat
Înapoi la proiectul tău de analiză a sentimentelor pe Twitter! Există mai multe tipuri de șiruri de caractere care îți complică analiza sentimentelor, dar care nu oferă nicio informație utilă în acest sens. Printre acestea se numără linkurile și mențiunile de utilizatori.
Pentru a curăța tweet-urile, vrei mai întâi să extragi câteva exemple. Știi că, de cele mai multe ori, linkurile încep cu http și nu conțin spații, de exemplu https://www.datacamp.com. Mențiunile de utilizatori încep cu @ și pot conține doar litere și cifre, de exemplu @johnsmith3.
Ai notat câțiva cuantificatori utili: * de zero sau mai multe ori, + o dată sau mai mult, ? de zero sau o dată.
Lista sentiment_analysis, care conține textul a trei tweet-uri, este deja încărcată în sesiunea ta. Poți folosi print() pentru a vizualiza datele în Shell-ul IPython.
Acest exercițiu face parte din cursul
Expresii regulate în Python
Instrucțiuni pentru exercițiu
- Importă modulul
re. - Scrie o expresie regulată pentru a găsi toate potrivirile linkurilor
httpcare apar în fiecaretweetdinsentiment_analysis. Afișează rezultatul. - Scrie o expresie regulată pentru a găsi toate potrivirile mențiunilor de utilizatori care apar în fiecare
tweetdinsentiment_analysis. Afișează rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))