NER cu spaCy
Recunoașterea entităților denumite (NER) te ajută să identifici cu ușurință elementele-cheie dintr-un document, cum ar fi nume de persoane sau locuri. Este utilă pentru a organiza datele nestructurate și pentru a detecta informații importante – esențial atunci când lucrezi cu seturi de date mari. În acest exercițiu, vei exersa recunoașterea entităților denumite.
en_core_web_sm a fost încărcat pentru tine ca nlp. Trei comentarii din setul de date Airline Travel Information System (ATIS) îți sunt puse la dispoziție într-o listă numită texts.
Acest exercițiu face parte din cursul
Procesarea limbajului natural cu spaCy
Instrucțiuni pentru exercițiu
- Construiește
documents, o listă cu toate containereleDocpentru fiecare text dintexts, folosind list comprehension. - Pentru fiecare container
doc, afișează textul fiecărei entități și eticheta corespunzătoare, iterând prindoc.ents. - Afișează textul celui de-al șaselea token și tipul de entitate al celui de-al doilea container
Doc.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Compile a list of all Doc containers of texts
documents = [____ for text in texts]
# Print the entity text and label for the entities in each document
for doc in documents:
print([(____, ____) for ent in ____])
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)