НачатьНачать бесплатно

Сходство спанов в spaCy

Определение семантического сходства помогает классифицировать тексты по заданным категориям, находить релевантные материалы или выявлять дублирующийся контент. В этом упражнении вы будете практиковаться в вычислении семантического сходства между фрагментами документа и заданным документом. Цель — найти наиболее релевантный Span из трёх токенов, соответствующий теме консервированного корма для собак.

Заданная категория консервированного корма для собак хранится в переменной category. Текстовая строка уже записана в объект text, а модель en_core_web_md загружена как nlp. Контейнер Doc для текста text также уже создан и хранится в переменной document.

Это упражнение является частью курса

Обработка естественного языка с помощью spaCy

Посмотреть курс

Инструкции к упражнению

  • Создайте контейнер Doc для переменной category и сохраните его в category_document.
  • Выведите оценку сходства между заданным Span и category_document, округлённую до трёх знаков после запятой.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)

# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))
Редактировать и запускать код