Tokenizace pomocí spaCy
V tomto cvičení si procvičíš tokenizaci textu. Použijeme první recenzi z datasetu Amazon Fine Food Reviews. Recenzi najdeš v objektu text, který je už připravený.
Model en_core_web_sm je již načtený a dostupný přes nlp(). Pro sestavení výstupních seznamů můžeš použít list comprehension.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Ulož kontejner Doc pro předem načtenou recenzi do objektu
document. - Ulož texty všech tokenů z
documentdo proměnnéfirst_text_tokensa prohlédni si je.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")