ÎncepețiÎncepe gratuit

Obținerea token-urilor

Următorul pas este să tokenizezi textul tweet-urilor tale. Tokenizarea este procesul de împărțire a unui șir de caractere în unități lexicale sau, mai simplu spus, în cuvinte. Înainte de asta, trebuie să elimini hashtag-urile, pentru ca ele să nu interfereze cu procesul tău. Observi că hashtag-urile încep cu simbolul # și conțin litere și cifre, niciodată spații. Apoi, intenționezi să împarți textul la potrivirile de spații albe pentru a obține token-urile.

Ai la îndemână lista de cuantificatori: * de zero sau mai multe ori, + o dată sau mai mult, ? de zero sau o dată, {n, m} minimum n, maximum m.

Variabila sentiment_analysis, care conține textul unui tweet, precum și modulul re sunt deja încărcate în sesiunea ta. Poți folosi print(sentiment_analysis) pentru a le vizualiza în Shell-ul IPython.

Acest exercițiu face parte din cursul

Expresii regulate în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Write a regex matching the hashtag pattern
regex = r"____"
Editează și rulează codul