ПочатиПочніть безкоштовно

NER у spaCy

Розпізнавання іменованих сутностей (Named Entity Recognition, NER) допомагає легко визначати ключові елементи документа, зокрема імена людей і назви місць. Це дає змогу впорядковувати неструктуровані дані та виявляти важливу інформацію, що особливо важливо під час роботи з великими наборами даних. У цій вправі ви потренуєтеся виконувати розпізнавання іменованих сутностей.

en_core_web_sm уже завантажено для вас як nlp. Три коментарі з набору даних Airline Travel Information System (ATIS) надано у списку texts.

Ця вправа є частиною курсу

Обробка природної мови (NLP) зі spaCy

Переглянути курс

Інструкції до вправи

  • Сформуйте documents — список усіх контейнерів Doc для кожного тексту з texts, використавши спискове включення (list comprehension).
  • Для кожного контейнера doc виведіть текст кожної сутності та відповідну мітку, ітеруючись через doc.ents.
  • Виведіть текст шостого токена та тип сутності другого контейнера Doc.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Compile a list of all Doc containers of texts
documents = [____ for text in texts]

# Print the entity text and label for the entities in each document
for doc in documents:
    print([(____, ____) for ent in ____])
    
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)
Редагувати та запускати код