ความคล้ายคลึงของ Doc ด้วย spaCy
ความคล้ายคลึงเชิงความหมาย (semantic similarity) คือกระบวนการวิเคราะห์ประโยคหลายประโยคเพื่อหาความเหมือนกัน ในแบบฝึกหัดนี้ จะได้ฝึกคำนวณความคล้ายคลึงเชิงความหมายของเอกสารต่าง ๆ เทียบกับเอกสารอ้างอิง โดยมีเป้าหมายเพื่อจัดหมวดหมู่รีวิวอาหารที่เกี่ยวข้องกับ อาหารสุนัขกระป๋อง
หมวดหมู่ อาหารสุนัขกระป๋อง ถูกเก็บไว้ในตัวแปร category และมีตัวอย่างรีวิวอาหาร 5 รายการในลิสต์ชื่อ texts ส่วน en_core_web_md โหลดไว้แล้วในชื่อ nlp
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การประมวลผลภาษาธรรมชาติด้วย spaCy
คำแนะนำการฝึกหัด
- สร้างลิสต์
documentsที่บรรจุDocของข้อความทั้งหมดในtexts - สร้าง
Docจากcategoryแล้วเก็บไว้ในตัวแปรcategory_document - วนซ้ำผ่าน
documentsและแสดงคะแนนความคล้ายคลึงของDocแต่ละตัวกับcategory_documentโดยปัดเป็นทศนิยม 3 ตำแหน่ง
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create a documents list containing Doc containers
documents = [____ for t in texts]
# Create a Doc container of the category
category = "canned dog food"
category_document = ____(____)
# Print similarity scores of each Doc container and the category_document
for i, doc in enumerate(documents):
print(f"Semantic similarity with document {i+1}:", round(doc.____(____), 3))