POS tagging pomocí spaCy
V tomto cvičení si procvičíš POS tagging. POS tagging je v NLP užitečný nástroj, protože algoritmům umožňuje porozumět gramatické struktuře věty a rozlišit slova s více významy, jako jsou třeba watch nebo play.
Pro toto cvičení je en_core_web_sm načtený jako nlp. V seznamu texts na tebe čekají tři komentáře z datasetu Airline Travel Information System (ATIS).
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Pomocí list comprehension sestavíš
documents— seznam všech kontejnerůdocpro každý text ze seznamutexts. - Pro každý kontejner
docvypíšeš text každého tokenu a jeho POS tag: projdidocumentsa tokeny každého kontejnerudocpomocí vnořeného cyklu for.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Compile a list of all Doc containers of texts
documents = [____(text) for text in texts]
# Print token texts and POS tags for each Doc container
for doc in documents:
for ____ in doc:
print("Text: ", ____, "| POS tag: ", ____)
print("\n")