Zacznij terazZacznij za darmo

Pozyskiwanie tokenów

Kolejnym krokiem jest tokenizacja tekstu tweetów. Tokenizacja to proces podziału ciągu znaków na jednostki leksykalne – czyli, mówiąc prościej, na słowa. Najpierw jednak musisz usunąć hashtagi, żeby nie zakłócały dalszego przetwarzania. Hashtagi zaczynają się od symbolu # i zawierają litery oraz cyfry, ale nigdy białe znaki. Po ich usunięciu podzielisz tekst w miejscach białych znaków, aby uzyskać tokeny.

Możesz skorzystać z listy kwantyfikatorów: * – zero lub więcej razy, + – raz lub więcej, ? – zero lub raz, {n, m} – minimum n, maksimum m.

Zmienna sentiment_analysis zawierająca tekst jednego tweeta oraz moduł re są już załadowane w sesji. Możesz użyć print(sentiment_analysis), aby wyświetlić jej zawartość w powłoce IPython.

To ćwiczenie jest częścią kursu

Wyrażenia regularne w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Write a regex matching the hashtag pattern
regex = r"____"
Edytuj i uruchom kod