Pozyskiwanie tokenów
Kolejnym krokiem jest tokenizacja tekstu tweetów. Tokenizacja to proces podziału ciągu znaków na jednostki leksykalne – czyli, mówiąc prościej, na słowa. Najpierw jednak musisz usunąć hashtagi, żeby nie zakłócały dalszego przetwarzania. Hashtagi zaczynają się od symbolu # i zawierają litery oraz cyfry, ale nigdy białe znaki. Po ich usunięciu podzielisz tekst w miejscach białych znaków, aby uzyskać tokeny.
Możesz skorzystać z listy kwantyfikatorów: * – zero lub więcej razy, + – raz lub więcej, ? – zero lub raz, {n, m} – minimum n, maksimum m.
Zmienna sentiment_analysis zawierająca tekst jednego tweeta oraz moduł re są już załadowane w sesji. Możesz użyć print(sentiment_analysis), aby wyświetlić jej zawartość w powłoce IPython.
To ćwiczenie jest częścią kursu
Wyrażenia regularne w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Write a regex matching the hashtag pattern
regex = r"____"