Tokenizace řetězce z GoT
Prvním standardním krokem při práci s textem je jeho tokenizace – jinými slovy rozdělení většího řetězce na jednotlivé menší řetězce, což jsou zpravidla jednotlivá slova (tokeny).
Pro tebe byl připraven řetězec GoT, který obsahuje citát z knihy Hra o trůny od George R. R. Martina. Tvým úkolem je rozdělit ho na jednotlivé tokeny.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Importuj funkci pro tokenizaci slov z
nltk. - Převeď řetězec
GoTna slovní tokeny.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the required function
from nltk import ____
# Transform the GoT string to word tokens
print(____(____))