Сходство документов с помощью spaCy
Семантическое сходство — это процесс анализа нескольких предложений с целью выявления общих черт между ними. В этом упражнении вы будете вычислять семантическое сходство документов с заданным документом. Цель — отобрать из списка отзывы, относящиеся к категории консервированный корм для собак.
Категория консервированный корм для собак хранится в переменной category. Список из пяти отзывов на продукты питания представлен в переменной texts. Модель en_core_web_md загружена как nlp.
Это упражнение является частью курса
Обработка естественного языка с помощью spaCy
Инструкции к упражнению
- Создайте список
documents, содержащий контейнерыDocдля всех элементовtexts. - Создайте контейнер
Docдля переменнойcategoryи сохраните его какcategory_document. - Переберите элементы списка
documentsи выведите оценки сходства каждого контейнераDocсcategory_document, округлённые до трёх знаков после запятой.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a documents list containing Doc containers
documents = [____ for t in texts]
# Create a Doc container of the category
category = "canned dog food"
category_document = ____(____)
# Print similarity scores of each Doc container and the category_document
for i, doc in enumerate(documents):
print(f"Semantic similarity with document {i+1}:", round(doc.____(____), 3))