Kom igångKom igång gratis

Span-likhet med spaCy

Att beräkna semantisk likhet kan hjälpa dig att kategorisera texter i fördefinierade kategorier, identifiera relevanta texter eller flagga duplicerat innehåll. I den här övningen tränar du på att beräkna den semantiska likheten mellan spans i ett dokument och ett givet dokument. Målet är att hitta det mest relevanta Span med tre tokens som är relaterat till konserverat hundmat.

Den angivna kategorin konserverat hundmat är lagrad i category. En textsträng finns redan lagrad i objektet text och en_core_web_md är inläst som nlp. Doc-objektet för text är också redan skapat och lagrat i document.

Den här övningen är en del av kursen

Naturlig språkbehandling med spaCy

Visa kurs

Övningsinstruktioner

  • Skapa ett Doc-objekt för category och lagra det i category_document.
  • Skriv ut likhetspoängen för ett givet Span och category_document, avrundad till tre decimaler.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)

# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))
Redigera och kör kod