使用 spaCy 計算 Span 相似度
語意相似度有助於把文字歸類到預先定義的類別、偵測相關文本,或標記重複內容。在本練習中,你將計算文件中多個 span 與指定文件之間的語意相似度。目標是找出最能代表「罐裝狗食」的 3 個 token 所組成的 Span。
「罐裝狗食」這個類別已存放在 category。文字字串已存於 text 物件,並且已載入 en_core_web_md 為 nlp。text 的 Doc 容器也已建立並存於 document。
本練習屬於課程
使用 spaCy 的自然語言處理
練習說明
- 為
category建立一個Doc容器並儲存為category_document。 - 列印給定
Span與category_document的相似度分數,並四捨五入至小數第 3 位。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))