Keras प्रीप्रोसेसिंग
Keras का दूसरा सबसे महत्वपूर्ण मॉड्यूल keras.preprocessing है. आप देखेंगे कि कच्चे डेटा को सही इनपुट शेप में तैयार करने के लिए सबसे महत्वपूर्ण मॉड्यूल्स और फंक्शंस का उपयोग कैसे करें. Keras वे सुविधाएँ देता है जो उस डिक्शनरी अप्रोच का विकल्प बनती हैं जिसे आपने पहले सीखा था.
आप keras.preprocessing.text.Tokenizer मॉड्यूल का उपयोग करेंगे. पहले मेथड .fit_on_texts() से शब्दों की एक डिक्शनरी बनाएँगे, और फिर मेथड .texts_to_sequences() से टेक्स्ट्स को न्यूमेरिकल ids में बदलेंगे जो डिक्शनरी में प्रत्येक शब्द के इंडेक्स का प्रतिनिधित्व करते हैं.
इसके बाद, keras.preprocessing.sequence से फ़ंक्शन .pad_sequences() का उपयोग करें ताकि सभी सीक्वेंस का आकार समान हो जाए (मॉडल के लिए आवश्यक). यह छोटे टेक्स्ट्स में शून्य जोड़कर और बड़े टेक्स्ट्स को काटकर किया जाएगा.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Keras के साथ भाषा मॉडलिंग के लिए Recurrent Neural Networks (RNNs)
अभ्यास निर्देश
- संबंधित मॉड्यूल्स से
Tokenizerऔरpad_sequencesइम्पोर्ट करें. textsमें संग्रहीत सैंपल डेटा परtokenizerऑब्जेक्ट को fit करें.- मेथड
.texts_to_sequences()का उपयोग करके टेक्स्ट्स को संख्यात्मक इंडेक्स की सीक्वेंस में बदलें. - पैडिंग करके टेक्स्ट्स का आकार फिक्स करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import relevant classes/functions
from tensorflow.keras.preprocessing.text import ____
from tensorflow.keras.preprocessing.sequence import ____
# Build the dictionary of indexes
tokenizer = Tokenizer()
tokenizer.fit_on_texts(____)
# Change texts into sequence of indexes
texts_numeric = tokenizer.____(texts)
print("Number of words in the sample texts: ({0}, {1})".format(len(texts_numeric[0]), len(texts_numeric[1])))
# Pad the sequences
texts_pad = ____(texts_numeric, 60)
print("Now the texts have fixed length: 60. Let's see the first one: \n{0}".format(texts_pad[0]))