इनपुट टेक्स्ट तैयार करना
आपने वीडियो में देखा कि इनपुट और आउटपुट टेक्स्ट कैसे तैयार किए जाते हैं. इस अभ्यास का उद्देश्य एक आम प्रैक्टिस दिखाना है: सभी वाक्यों को उनकी अधिकतम लंबाई तक pad करना, ताकि कोई जानकारी न खोए.
क्योंकि RNN मॉडल्स को एक ही साइज़ के इनपुट चाहिए होते हैं, इसलिए यह तरीका सभी वाक्यों को pad कर देता है और छोटे वाक्यों में zeros जोड़ता है, बिना बड़े वाक्यों को काटे.
साथ ही, आप tokens को दर्शाने के लिए characters के बजाय words का उपयोग करेंगे. NMT मॉडल्स में यह एक सामान्य तरीका है.
Portuguese टेक्स्ट pt_sentences वैरिएबल में लोड हैं और एक fitted tokenizer input_tokenizer वैरिएबल में उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Keras के साथ भाषा मॉडलिंग के लिए Recurrent Neural Networks (RNNs)
अभ्यास निर्देश
- प्रत्येक वाक्य पर
.split()मेथड का उपयोग करके white space के आधार पर split करें और वाक्य में शब्दों की संख्या प्राप्त करें. .texts_to_sequences()मेथड का उपयोग करके टेक्स्ट को indexes की sequence में बदलें.- प्राप्त अधिकतम वाक्य-लंबाई का उपयोग करके उन्हें pad करें.
- पहली बदली हुई (transformed) sentence को प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Get maximum length of the sentences
pt_length = max([len(sentence.____) for sentence in pt_sentences])
# Transform text to sequence of numerical indexes
X = input_tokenizer.____(pt_sentences)
# Pad the sequences
X = pad_sequences(X, maxlen=____, padding='post')
# Print first sentence
print(pt_sentences[0])
# Print transformed sentence
print(____)