Сходство спанов в spaCy
Определение семантического сходства помогает классифицировать тексты по заданным категориям, находить релевантные материалы или выявлять дублирующийся контент. В этом упражнении вы будете практиковаться в вычислении семантического сходства между фрагментами документа и заданным документом. Цель — найти наиболее релевантный Span из трёх токенов, соответствующий теме консервированного корма для собак.
Заданная категория консервированного корма для собак хранится в переменной category. Текстовая строка уже записана в объект text, а модель en_core_web_md загружена как nlp. Контейнер Doc для текста text также уже создан и хранится в переменной document.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Создайте контейнер
Docдля переменнойcategoryи сохраните его вcategory_document. - Выведите оценку сходства между заданным
Spanиcategory_document, округлённую до трёх знаков после запятой.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))