NER se spaCy
Rozpoznávání pojmenovaných entit (NER) ti umožňuje snadno identifikovat klíčové prvky daného dokumentu, například jména osob nebo názvů míst. Pomáhá třídit nestrukturovaná data a odhalovat důležité informace, což je zásadní při práci s velkými datovými sadami. V tomto cvičení si procvičíš rozpoznávání pojmenovaných entit.
en_core_web_sm je pro tebe načteno jako nlp. V seznamu texts máš připravené tři komentáře z datové sady ATIS (Airline Travel Information System).
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Pomocí list comprehension sestav seznam
documentsobsahující kontejneryDocpro každý text ze seznamutexts. - Pro každý kontejner
docprojdidoc.entsa vypiš text každé entity spolu s jejím příslušným štítkem. - Vypiš text šestého tokenu a typ entity druhého kontejneru
Doc.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Compile a list of all Doc containers of texts
documents = [____ for text in texts]
# Print the entity text and label for the entities in each document
for doc in documents:
print([(____, ____) for ent in ____])
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)