Začněte nyníZačněte zdarma

Tokenizace řetězce z GoT

Prvním standardním krokem při práci s textem je jeho tokenizace – jinými slovy rozdělení většího řetězce na jednotlivé menší řetězce, což jsou zpravidla jednotlivá slova (tokeny).

Pro tebe byl připraven řetězec GoT, který obsahuje citát z knihy Hra o trůny od George R. R. Martina. Tvým úkolem je rozdělit ho na jednotlivé tokeny.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj funkci pro tokenizaci slov z nltk.
  • Převeď řetězec GoT na slovní tokeny.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the required function
from nltk import ____

# Transform the GoT string to word tokens
print(____(____))
Upravit a spustit kód