spaCy के साथ Span similarity
समानार्थकता (semantic similarity) मापना आपको टेक्स्ट को पहले से तय श्रेणियों में वर्गीकृत करने, प्रासंगिक टेक्स्ट पहचानने, या डुप्लीकेट कंटेंट फ़्लैग करने में मदद कर सकता है. इस अभ्यास में, आप किसी दिए गए डॉक्यूमेंट के साथ उसी डॉक्यूमेंट के विभिन्न स्पैन की समानार्थकता निकालने का अभ्यास करेंगे. लक्ष्य है तीन-टोकन वाले उस Span को खोजना जो canned dog food से सबसे अधिक प्रासंगिक हो.
canned dog food की दी गई श्रेणी category में स्टोर है. एक टेक्स्ट स्ट्रिंग पहले से text ऑब्जेक्ट में है और en_core_web_md nlp के रूप में लोड है. text का Doc कंटेनर भी पहले से बनाया जा चुका है और document में स्टोर है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
spaCy के साथ Natural Language Processing
अभ्यास निर्देश
categoryके लिए एकDocकंटेनर बनाएँ और उसेcategory_documentमें स्टोर करें.- दिए गए
Spanऔरcategory_documentकी similarity स्कोर प्रिंट करें, जिसे तीन अंकों तक राउंड किया गया हो.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create a Doc container for the category
category = "canned dog food"
category_document = nlp(____)
# Print similarity score of a given Span and category_document
document_span = document[0:3]
print(f"Semantic similarity with", document_span.text, ":", round(document_span.____(____), 3))