NER у spaCy
Розпізнавання іменованих сутностей (Named Entity Recognition, NER) допомагає легко визначати ключові елементи документа, зокрема імена людей і назви місць. Це дає змогу впорядковувати неструктуровані дані та виявляти важливу інформацію, що особливо важливо під час роботи з великими наборами даних. У цій вправі ви потренуєтеся виконувати розпізнавання іменованих сутностей.
en_core_web_sm уже завантажено для вас як nlp. Три коментарі з набору даних Airline Travel Information System (ATIS) надано у списку texts.
Ця вправа є частиною курсу
Обробка природної мови (NLP) зі spaCy
Інструкції до вправи
- Сформуйте
documents— список усіх контейнерівDocдля кожного тексту зtexts, використавши спискове включення (list comprehension). - Для кожного контейнера
docвиведіть текст кожної сутності та відповідну мітку, ітеруючись черезdoc.ents. - Виведіть текст шостого токена та тип сутності другого контейнера
Doc.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Compile a list of all Doc containers of texts
documents = [____ for text in texts]
# Print the entity text and label for the entities in each document
for doc in documents:
print([(____, ____) for ent in ____])
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)