Span-likhet med spaCy
Att beräkna semantisk likhet kan hjälpa dig att kategorisera texter i fördefinierade kategorier, identifiera relevanta texter eller flagga duplicerat innehåll. I den här övningen tränar du på att beräkna den semantiska likheten mellan spans i ett dokument och ett givet dokument. Målet är att hitta det mest relevanta Span med tre tokens som är relaterat till konserverat hundmat.
Den angivna kategorin konserverat hundmat är lagrad i category. En textsträng finns redan lagrad i objektet text och en_core_web_md är inläst som nlp. Doc-objektet för text är också redan skapat och lagrat i document.
Den här övningen är en del av kursen
Naturlig språkbehandling med spaCy
Övningsinstruktioner
- Skapa ett
Doc-objekt förcategoryoch lagra det icategory_document. - Skriv ut likhetspoängen för ett givet
Spanochcategory_document, avrundad till tre decimaler.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))