Začněte nyníZačněte zdarma

Podobnost úseků (Span) v spaCy

Určování sémantické podobnosti ti může pomoci zařazovat texty do předem definovaných kategorií, vyhledávat relevantní texty nebo odhalovat duplicitní obsah. V tomto cvičení si procvičíš výpočet sémantické podobnosti úseků dokumentu vůči zadanému dokumentu. Cílem je najít nejrelevantnější Span tří tokenů odpovídající kategorii konzervované psí krmivo.

Zadaná kategorie konzervované psí krmivo je uložena v proměnné category. Textový řetězec je již uložen v objektu text a model en_core_web_md je načten jako nlp. Kontejner Doc pro text je také již vytvořen a uložen v proměnné document.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka s knihovnou spaCy

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř kontejner Doc pro proměnnou category a ulož ho do category_document.
  • Vypiš skóre podobnosti daného úseku Span a proměnné category_document, zaokrouhlené na tři desetinná místa.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)

# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))
Upravit a spustit kód