НачатьНачать бесплатно

Распознавание именованных сущностей с помощью spaCy

Распознавание именованных сущностей (Named Entity Recognition, NER) позволяет быстро выделять ключевые элементы текста: имена людей, названия мест и многое другое. Это помогает структурировать неупорядоченные данные и находить важную информацию — особенно при работе с большими наборами данных. В этом упражнении вы попрактикуетесь в распознавании именованных сущностей.

Модель en_core_web_sm уже загружена как nlp. В списке texts подготовлены три комментария из набора данных Airline Travel Information System (ATIS).

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • Создайте список documents, содержащий контейнеры Doc для каждого текста из texts, используя генератор списков.
  • Для каждого контейнера doc выведите текст каждой сущности и её соответствующую метку, перебрав элементы doc.ents.
  • Выведите текст шестого токена и тип сущности второго контейнера Doc.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Compile a list of all Doc containers of texts
documents = [____ for text in texts]

# Print the entity text and label for the entities in each document
for doc in documents:
    print([(____, ____) for ent in ____])
    
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)
Редактировать и запускать код