Similaritatea unui Span cu spaCy
Determinarea similarității semantice te poate ajuta să clasifici texte în categorii predefinite, să identifici texte relevante sau să detectezi conținut duplicat. În acest exercițiu, vei exersa calcularea similarității semantice a unor span-uri dintr-un document față de un document dat. Scopul este să găsești cel mai relevant Span de trei tokeni care se referă la hrană la conservă pentru câini.
Categoria dată, hrană la conservă pentru câini, este stocată în category. Un șir de text este deja stocat în obiectul text, iar modelul en_core_web_md este încărcat ca nlp. Containerul Doc al textului text a fost creat și stocat în document.
Acest exercițiu face parte din cursul
Procesarea limbajului natural cu spaCy
Instrucțiuni pentru exercițiu
- Creează un container
Docpentrucategoryși stochează-l încategory_document. - Afișează scorul de similaritate dintre un
Spandat șicategory_document, rotunjit la trei zecimale.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))