वोकैब्युलरी में मिलते-जुलते शब्द
सूचना पुनर्प्राप्ति (information retrieval) में सैमांटिक रूप से मिलते-जुलते टर्म्स ढूँढने के कई उपयोग हैं। इस अभ्यास में, आप en_core_web_md मॉडल की वोकैब्युलरी से शब्द computer के साथ सबसे सैमांटिक रूप से मिलते-जुलते टर्म को ढूँढने का अभ्यास करेंगे.
computer का word vector पहले से निकाला जा चुका है और word_vector के रूप में सेव है। en_core_web_md मॉडल nlp के रूप में लोड है, और NumPy पैकेज np के रूप में उपलब्ध है.
आप nlp.vocab.vectors ऑब्जेक्ट के .most_similar() फंक्शन का उपयोग करके सबसे सैमांटिक रूप से मिलते-जुलते टर्म्स पा सकते हैं। इस फंक्शन के आउटपुट पर [0][0] से इंडेक्सिंग करने पर सैमांटिक रूप से मिलते-जुलते टर्म्स के word IDs मिलेंगे। nlp.vocab.strings[<a given word>] का उपयोग किसी दिए गए शब्द का word ID पाने के लिए किया जा सकता है और इसी तरह किसी दिए गए word ID से संबंधित शब्द भी लौटाया जा सकता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
spaCy के साथ Natural Language Processing
अभ्यास निर्देश
en_core_web_mdवोकैब्युलरी से सबसे सैमांटिक रूप से मिलता-जुलता टर्म ढूँढें.- समान टर्म्स के word IDs दिए होने पर मिलते-जुलते शब्दों की सूची निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Find the most similar word to the word computer
most_similar_words = nlp.vocab.vectors.____(np.asarray([____]), n = 1)
# Find the list of similar words given the word IDs
words = [nlp.____.____[____] for w in most_similar_words[0][0]]
print(words)