शुरू करेंमुफ़्त में शुरू करें

Word2Vec

इस अभ्यास में आप Keras का उपयोग करके एक Word2Vec मॉडल बनाएँगे.

मॉडल को प्री-ट्रेन करने के लिए जिस कॉर्पस का उपयोग किया गया है, वह The Big Bang Theory टीवी शो के सभी एपिसोड्स की स्क्रिप्ट है, जिसे वाक्य-दर-वाक्य विभाजित किया गया है. यह bigbang वैरिएबल में उपलब्ध है.

कॉर्पस के टेक्स्ट को लोअरकेस में बदला गया है और सभी शब्दों को टोकनाइज़ किया गया है. परिणाम tokenized_corpus वैरिएबल में संग्रहीत है.

एक Word2Vec मॉडल को 10 शब्दों की विंडो साइज (सेंटर शब्द से पहले 5 और बाद में 5) के साथ प्री-ट्रेन किया गया. जिन शब्दों की आवृत्ति 3 से कम थी, उन्हें हटा दिया गया, और 50-डायमेंशन के साथ स्किप-ग्राम मॉडल मेथड का उपयोग किया गया. मॉडल bigbang_word2vec.model फ़ाइल में सेव है.

क्लास Word2Vec पहले से ही gensim.models.word2vec से एनवायरनमेंट में लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Keras के साथ भाषा मॉडलिंग के लिए Recurrent Neural Networks (RNNs)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • प्री-ट्रेन किया गया Word2Vec मॉडल लोड करें.
  • शब्द "bazinga", "penny", "universe", "spock", "brain" को उसी क्रम में रखते हुए एक list बनाकर वैरिएबल words_of_interest में स्टोर करें.
  • हर शब्द पर इटेरेट करें, एट्रिब्यूट wv पर उपलब्ध .most_similar() मेथड का उपयोग करें, और शीर्ष 5 समान शब्दों को top5_similar_words में एक dictionary के रूप में append करें.
  • रुचि के प्रत्येक शब्द के लिए पाए गए शीर्ष 5 शब्दों को प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Word2Vec model
w2v_model = Word2Vec.load(____)

# Selected words to check similarities
words_of_interest = ____

# Compute top 5 similar words for each of the words of interest
top5_similar_words = []
for word in words_of_interest:
    top5_similar_words.append(
      {word: [item[0] for item in w2v_model.wv.____([word], topn=5)]}
    )

# Print the similar words
____
कोड संपादित करें और चलाएँ