ПочатиПочніть безкоштовно

Подібність Span у spaCy

Визначення семантичної подібності допомагає класифікувати тексти за наперед заданими категоріями, виявляти релевантні тексти або позначати дублікати. У цій вправі ви потренуєтеся обчислювати семантичну подібність фрагментів (spans) документа до заданого документа. Мета — знайти найрелевантніший Span із трьох токенів, пов'язаний із canned dog food.

Задана категорія canned dog food збережена у змінній category. Рядок тексту вже збережено в об'єкті text, а модель en_core_web_md завантажено як nlp. Контейнер Doc для text також уже створено й збережено в document.

Ця вправа є частиною курсу

Обробка природної мови (NLP) зі spaCy

Переглянути курс

Інструкції до вправи

  • Створіть контейнер Doc для category і збережіть його в category_document.
  • Виведіть значення коефіцієнта подібності заданого Span і category_document, округлене до трьох знаків.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)

# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))
Редагувати та запускати код