Word vectors प्रोजेक्शन
आप वर्ड वेक्टर को एक scatter plot में विज़ुअलाइज़ कर सकते हैं ताकि आप समझ सकें कि vocabulary के शब्द कैसे समूहित हैं. वर्ड वेक्टर को विज़ुअलाइज़ करने के लिए, आपको उन्हें दो-आयामी स्पेस में प्रोजेक्ट करना होता है. आप Principal Component Analysis (PCA) के जरिए दो principal components निकालकर वेक्टर को प्रोजेक्ट कर सकते हैं.
इस अभ्यास में, आप सीखेंगे कि वर्ड वेक्टर कैसे निकाले जाएँ और sklearn की PCA लाइब्रेरी का उपयोग करके उन्हें दो-आयामी स्पेस में कैसे प्रोजेक्ट किया जाए.
words सूची में संग्रहीत शब्दों की एक छोटी सूची और en_core_web_md मॉडल उपयोग के लिए उपलब्ध हैं. मॉडल nlp के रूप में लोड है. सभी आवश्यक लाइब्रेरी और पैकेज पहले से इम्पोर्ट किए गए हैं (PCA, numpy as np).
यह अभ्यास पाठ्यक्रम का हिस्सा है
spaCy के साथ Natural Language Processing
अभ्यास निर्देश
- दिए गए शब्दों से word IDs निकालें और उन्हें
word_idsसूची में स्टोर करें. - शब्दों के वर्ड वेक्टर के पहले पाँच एलिमेंट्स निकालें और फिर
np.vstack()का उपयोग करके उन्हें वर्टिकली स्टैक करें, परिणामword_vectorsमें रखें. - दिए गए
pcaऑब्जेक्ट के साथ, ट्रांसफ़ॉर्म किए गए वर्ड वेक्टर.fit_transform()फ़ंक्शन (क्लासpca) से निकालें. - ट्रांसफ़ॉर्म किए गए वर्ड वेक्टर के पहले component को
[:, 0]इंडेक्सिंग से प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
words = ["tiger", "bird"]
# Extract word IDs of given words
word_ids = [nlp.____.____[w] for w in words]
# Extract word vectors and stack the first five elements vertically
word_vectors = np.vstack([nlp.____.____[i][:5] for i in word_ids])
# Calculate the transformed word vectors using the pca object
pca = PCA(n_components=2)
word_vectors_transformed = pca.____(____)
# Print the first component of the transformed word vectors
print(____[:, 0])