Začněte nyníZačněte zdarma

NER se spaCy

Rozpoznávání pojmenovaných entit (NER) ti umožňuje snadno identifikovat klíčové prvky daného dokumentu, například jména osob nebo názvů míst. Pomáhá třídit nestrukturovaná data a odhalovat důležité informace, což je zásadní při práci s velkými datovými sadami. V tomto cvičení si procvičíš rozpoznávání pojmenovaných entit.

en_core_web_sm je pro tebe načteno jako nlp. V seznamu texts máš připravené tři komentáře z datové sady ATIS (Airline Travel Information System).

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Pomocí list comprehension sestav seznam documents obsahující kontejnery Doc pro každý text ze seznamu texts.
  • Pro každý kontejner doc projdi doc.ents a vypiš text každé entity spolu s jejím příslušným štítkem.
  • Vypiš text šestého tokenu a typ entity druhého kontejneru Doc.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Compile a list of all Doc containers of texts
documents = [____ for text in texts]

# Print the entity text and label for the entities in each document
for doc in documents:
    print([(____, ____) for ent in ____])
    
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)
Upravit a spustit kód