Začněte nyníZačněte zdarma

Získávání tokenů

Dalším krokem je tokenizace textu tweetů. Tokenizace je proces, při kterém rozdělíš řetězec na lexikální jednotky – jednoduše řečeno na slova. Nejprve ale musíš odstranit hashtagy, aby ti nepletly proces. Hashtagy začínají symbolem # a obsahují písmena a čísla, nikdy ale mezery. Poté plánuješ rozdělit text na místech, kde se vyskytuje bílý znak, a získat tak tokeny.

Máš k dispozici přehled kvantifikátorů: * nula nebo vícekrát, + jednou nebo vícekrát, ? nula nebo jednou, {n, m} minimálně n, maximálně m.

Proměnná sentiment_analysis obsahující text jednoho tweetu a modul re jsou již načteny v prostředí. Text si můžeš zobrazit pomocí print(sentiment_analysis) v IPython Shellu.

Toto cvičení je součástí kurzu

Regular Expressions in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Write a regex matching the hashtag pattern
regex = r"____"
Upravit a spustit kód