Podobnost úseků (Span) v spaCy
Určování sémantické podobnosti ti může pomoci zařazovat texty do předem definovaných kategorií, vyhledávat relevantní texty nebo odhalovat duplicitní obsah. V tomto cvičení si procvičíš výpočet sémantické podobnosti úseků dokumentu vůči zadanému dokumentu. Cílem je najít nejrelevantnější Span tří tokenů odpovídající kategorii konzervované psí krmivo.
Zadaná kategorie konzervované psí krmivo je uložena v proměnné category. Textový řetězec je již uložen v objektu text a model en_core_web_md je načten jako nlp. Kontejner Doc pro text je také již vytvořen a uložen v proměnné document.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka s knihovnou spaCy
Pokyny k cvičení
- Vytvoř kontejner
Docpro proměnnoucategorya ulož ho docategory_document. - Vypiš skóre podobnosti daného úseku
Spana proměnnécategory_document, zaokrouhlené na tři desetinná místa.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))