Začněte nyníZačněte zdarma

Tokenizace pomocí spaCy

V tomto cvičení si procvičíš tokenizaci textu. Použijeme první recenzi z datasetu Amazon Fine Food Reviews. Recenzi najdeš v objektu text, který je už připravený.

Model en_core_web_sm je již načtený a dostupný přes nlp(). Pro sestavení výstupních seznamů můžeš použít list comprehension.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Ulož kontejner Doc pro předem načtenou recenzi do objektu document.
  • Ulož texty všech tokenů z document do proměnné first_text_tokens a prohlédni si je.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a Doc container of the given text
document = ____(____)
    
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")
Upravit a spustit kód