始める無料で始める

spaCy での Span 類似度

意味的な類似度を測ると、テキストをあらかじめ定義したカテゴリに分類したり、関連するテキストを検出したり、重複コンテンツにフラグを立てたりできます。この演習では、与えられた文書と、その文書内のスパンとの意味的類似度を計算する練習をします。目的は、canned dog food(犬用ウェット缶詰)に最も関連する、3 トークンからなる Span を見つけることです。

カテゴリ canned dog foodcategory に保存されています。テキスト文字列はすでに text に格納され、en_core_web_mdnlp として読み込まれています。textDoc コンテナも作成済みで、document に保存されています。

この演習はコースの一部です

spaCyで学ぶNatural Language Processing

コースを見る

演習の手順

  • categoryDoc コンテナを作成し、category_document に保存します。
  • 与えられた Spancategory_document の類似度スコアを、小数点以下 3 桁に丸めて出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)

# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))
コードを編集して実行