開始使用免費開始

使用 spaCy 計算 Span 相似度

語意相似度有助於把文字歸類到預先定義的類別、偵測相關文本,或標記重複內容。在本練習中,你將計算文件中多個 span 與指定文件之間的語意相似度。目標是找出最能代表「罐裝狗食」的 3 個 token 所組成的 Span

「罐裝狗食」這個類別已存放在 category。文字字串已存於 text 物件,並且已載入 en_core_web_mdnlptextDoc 容器也已建立並存於 document

本練習屬於課程

使用 spaCy 的自然語言處理

檢視課程

練習說明

  • category 建立一個 Doc 容器並儲存為 category_document
  • 列印給定 Spancategory_document 的相似度分數,並四捨五入至小數第 3 位。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)

# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))
編輯並執行程式碼