Keras के साथ वाक्यों को tokenize करना
यहाँ आप Keras Tokenizer के साथ व्यावहारिक रूप से काम करेंगे। Keras Tokenizer एक बढ़िया यूटिलिटी है जो आपको कुछ ज़रूरी टेक्स्ट प्रोसेसिंग कुछ ही लाइनों के कोड में करने देती है। उदाहरण के लिए, Keras Tokenizer आपकी vocabulary के शब्दों को एक ही फंक्शन कॉल में अपने-आप IDs से मैप कर देता है। यहाँ, आप इसे थोड़ी और विस्तार से सीखेंगे।
आप एक Keras Tokenizer ऑब्जेक्ट बनाएँगे और उसे कुछ टेक्स्ट पर फिट करेंगे, जिससे Tokenizer शब्दों और उनके संबंधित IDs का एक dictionary बना सके। Tokenizer को ट्रेन करने के लिए प्रयुक्त टेक्स्ट Udacity Github Repo से लिया गया है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Keras के साथ Machine Translation
अभ्यास निर्देश
- एक Keras Tokenizer ऑब्जेक्ट परिभाषित करें.
en_textपर tokenizer फिट करें.- दी गई सूची
["january", "apples", "summer"]में प्रत्येक शब्दwके लिए उसका word ID प्राप्त करें. - शब्द और उससे संबंधित ID प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)