आउटपुट टेक्स्ट तैयार करना
इस अभ्यास में, आप ट्रांसलेशन मॉडल के लिए इस्तेमाल होने वाले आउटपुट टेक्स्ट तैयार करेंगे. टेक्स्ट को इंडेक्स की सीक्वेन्स में बदलने के अलावा, आपको हर इंडेक्स को वन-हॉट एन्कोड भी करना है.
English टेक्स्ट en_sentences वैरिएबल में लोड हैं, फिट किया हुआ tokenizer output_tokenizer वैरिएबल में है और English शब्द-संग्रह (vocabulary) का आकार en_vocab_size में है.
साथ ही, आउटपुट भाषा को बदलने के शुरुआती स्टेप्स (टेक्स्ट को इंडेक्स की सीक्वेन्स में बदलना) के लिए एक फंक्शन पहले से बना हुआ है. यह फंक्शन एनवायरनमेंट में transform_text_to_sequences() नाम से लोड है और इसके दो पैरामीटर हैं: sentences जिसमें English वाक्यों की लिस्ट अपेक्षित है, और tokenizer जिसमें keras.preprocessing.text मॉड्यूल से फिट किया हुआ Tokenizer ऑब्जेक्ट अपेक्षित है.
numpy को np नाम से लोड किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Keras के साथ भाषा मॉडलिंग के लिए Recurrent Neural Networks (RNNs)
अभ्यास निर्देश
en_sentencesऔरoutput_tokenizerवैरिएबल्स कोtransform_text_to_sequences()फंक्शन में पास करकेYवैरिएबल इनिशियलाइज़ करें.- वाक्यों को वन-हॉट एन्कोड करने के लिए
to_categorical()फंक्शन का उपयोग करें. क्लासों की संख्या के रूप मेंen_vocab_sizeवैरिएबल का उपयोग करें. - अस्थायी लिस्ट को numpy array में बदलें और उसे इस प्रकार reshape करें कि shape
(num_sentences, sentences_len, en_vocab_size)के बराबर हो. - कच्चा टेक्स्ट और बदला हुआ टेक्स्ट, दोनों प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Initialize the variable
Y = transform_text_to_sequences(____, ____)
# Temporary list
ylist = list()
for sequence in Y:
# One-hot encode sentence and append to list
ylist.append(____(sequence, num_classes=____))
# Update the variable
Y = np.array(ylist).reshape(____, Y.shape[1], en_vocab_size)
# Print the raw sentence and its transformed version
print("Raw sentence: {0}\nTransformed: {1}".format(____, Y[0]))