ความคล้ายคลึงของ Span ด้วย spaCy
การหาความคล้ายคลึงเชิงความหมายช่วยให้จัดหมวดหมู่ข้อความตามประเภทที่กำหนดไว้ล่วงหน้า ตรวจจับข้อความที่เกี่ยวข้อง หรือระบุเนื้อหาที่ซ้ำกันได้ ในแบบฝึกหัดนี้ จะได้ฝึกคำนวณความคล้ายคลึงเชิงความหมายระหว่าง Span ของเอกสารกับเอกสารที่กำหนด โดยมีเป้าหมายเพื่อค้นหา Span ที่มี 3 token ซึ่งเกี่ยวข้องกับ canned dog food มากที่สุด
หมวดหมู่ canned dog food ที่กำหนดไว้เก็บอยู่ใน category ส่วนข้อความถูกเก็บไว้ในออบเจกต์ text แล้ว และโหลด en_core_web_md เป็น nlp ไว้เรียบร้อยแล้ว นอกจากนี้ Doc container ของ text ก็ถูกสร้างและเก็บไว้ใน document แล้วเช่นกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติด้วย spaCy
คำแนะนำการฝึกหัด
- สร้าง
Doccontainer สำหรับcategoryแล้วเก็บไว้ในcategory_document - แสดงค่าคะแนนความคล้ายคลึงของ
Spanที่กำหนดกับcategory_documentโดยปัดให้เหลือ 3 ตำแหน่งทศนิยม
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))