शुरू करेंमुफ़्त में शुरू करें

Keras के साथ वाक्यों को tokenize करना

यहाँ आप Keras Tokenizer के साथ व्यावहारिक रूप से काम करेंगे। Keras Tokenizer एक बढ़िया यूटिलिटी है जो आपको कुछ ज़रूरी टेक्स्ट प्रोसेसिंग कुछ ही लाइनों के कोड में करने देती है। उदाहरण के लिए, Keras Tokenizer आपकी vocabulary के शब्दों को एक ही फंक्शन कॉल में अपने-आप IDs से मैप कर देता है। यहाँ, आप इसे थोड़ी और विस्तार से सीखेंगे।

आप एक Keras Tokenizer ऑब्जेक्ट बनाएँगे और उसे कुछ टेक्स्ट पर फिट करेंगे, जिससे Tokenizer शब्दों और उनके संबंधित IDs का एक dictionary बना सके। Tokenizer को ट्रेन करने के लिए प्रयुक्त टेक्स्ट Udacity Github Repo से लिया गया है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Keras के साथ Machine Translation

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक Keras Tokenizer ऑब्जेक्ट परिभाषित करें.
  • en_text पर tokenizer फिट करें.
  • दी गई सूची ["january", "apples", "summer"] में प्रत्येक शब्द w के लिए उसका word ID प्राप्त करें.
  • शब्द और उससे संबंधित ID प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
कोड संपादित करें और चलाएँ