Распознавание именованных сущностей с помощью spaCy
Распознавание именованных сущностей (Named Entity Recognition, NER) позволяет быстро выделять ключевые элементы текста: имена людей, названия мест и многое другое. Это помогает структурировать неупорядоченные данные и находить важную информацию — особенно при работе с большими наборами данных. В этом упражнении вы попрактикуетесь в распознавании именованных сущностей.
Модель en_core_web_sm уже загружена как nlp. В списке texts подготовлены три комментария из набора данных Airline Travel Information System (ATIS).
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Создайте список
documents, содержащий контейнерыDocдля каждого текста изtexts, используя генератор списков. - Для каждого контейнера
docвыведите текст каждой сущности и её соответствующую метку, перебрав элементыdoc.ents. - Выведите текст шестого токена и тип сущности второго контейнера
Doc.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Compile a list of all Doc containers of texts
documents = [____ for text in texts]
# Print the entity text and label for the entities in each document
for doc in documents:
print([(____, ____) for ent in ____])
# Print the 6th token's text and entity type of the second document
print("\nText:", documents[1][5].____, "| Entity type: ", documents[1][5].____)