शुरू करेंमुफ़्त में शुरू करें

Word vectors प्रोजेक्शन

आप वर्ड वेक्टर को एक scatter plot में विज़ुअलाइज़ कर सकते हैं ताकि आप समझ सकें कि vocabulary के शब्द कैसे समूहित हैं. वर्ड वेक्टर को विज़ुअलाइज़ करने के लिए, आपको उन्हें दो-आयामी स्पेस में प्रोजेक्ट करना होता है. आप Principal Component Analysis (PCA) के जरिए दो principal components निकालकर वेक्टर को प्रोजेक्ट कर सकते हैं.

इस अभ्यास में, आप सीखेंगे कि वर्ड वेक्टर कैसे निकाले जाएँ और sklearn की PCA लाइब्रेरी का उपयोग करके उन्हें दो-आयामी स्पेस में कैसे प्रोजेक्ट किया जाए.

words सूची में संग्रहीत शब्दों की एक छोटी सूची और en_core_web_md मॉडल उपयोग के लिए उपलब्ध हैं. मॉडल nlp के रूप में लोड है. सभी आवश्यक लाइब्रेरी और पैकेज पहले से इम्पोर्ट किए गए हैं (PCA, numpy as np).

यह अभ्यास पाठ्यक्रम का हिस्सा है

spaCy के साथ Natural Language Processing

पाठ्यक्रम देखें

अभ्यास निर्देश

  • दिए गए शब्दों से word IDs निकालें और उन्हें word_ids सूची में स्टोर करें.
  • शब्दों के वर्ड वेक्टर के पहले पाँच एलिमेंट्स निकालें और फिर np.vstack() का उपयोग करके उन्हें वर्टिकली स्टैक करें, परिणाम word_vectors में रखें.
  • दिए गए pca ऑब्जेक्ट के साथ, ट्रांसफ़ॉर्म किए गए वर्ड वेक्टर .fit_transform() फ़ंक्शन (क्लास pca) से निकालें.
  • ट्रांसफ़ॉर्म किए गए वर्ड वेक्टर के पहले component को [:, 0] इंडेक्सिंग से प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

words = ["tiger", "bird"]

# Extract word IDs of given words
word_ids = [nlp.____.____[w] for w in words]

# Extract word vectors and stack the first five elements vertically
word_vectors = np.vstack([nlp.____.____[i][:5] for i in word_ids])

# Calculate the transformed word vectors using the pca object
pca = PCA(n_components=2)
word_vectors_transformed = pca.____(____)

# Print the first component of the transformed word vectors
print(____[:, 0])
कोड संपादित करें और चलाएँ