शुरू करेंमुफ़्त में शुरू करें

भाग 1: डेटासेट का अन्वेषण

अब आप डेटासेट को थोड़ा एक्सप्लोर करेंगे। पहले आप जानेंगे कि डेटा कैसा दिखता है। आप कुछ डेटा प्रिंट करेंगे और सीखेंगे कि वाक्यों को कैसे टोकनाइज़ करके अलग-अलग शब्दों में तोड़ा जाए। अंग्रेज़ी के लिए टोकनाइज़ेशन आसान लगता है, लेकिन जापानी जैसी भाषाएँ अंग्रेज़ी की तरह लगातार डिलिमिटेड नहीं होतीं, इसलिए वहाँ यह कठिन हो सकता है.

इस अभ्यास के लिए आपको दो डेटासेट दिए गए हैं: en_text और fr_texten_text में अंग्रेज़ी वाक्यों की सूची है, और fr_text में उन्हीं के अनुरूप फ़्रेंच वाक्यों की सूची है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Keras के साथ Machine Translation

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक zip() फंक्शन लिखें जो अंग्रेज़ी (en_text) और फ़्रेंच (fr_text) की पहली 5 पंक्तियों/वाक्यों पर एक साथ इटेरेट करे.
  • en_text से पहला अंग्रेज़ी वाक्य लें.
  • प्राप्त वाक्य को space कैरेक्टर के आधार पर split() फंक्शन से टोकनाइज़ करें और परिणाम first_words में असाइन करें.
  • टोकनाइज़ किए गए शब्द प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):  
  print("English: ", en_sent)
  print("\tFrench: ", fr_sent)

# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)
कोड संपादित करें और चलाएँ