भाग 1: डेटासेट का अन्वेषण
अब आप डेटासेट को थोड़ा एक्सप्लोर करेंगे। पहले आप जानेंगे कि डेटा कैसा दिखता है। आप कुछ डेटा प्रिंट करेंगे और सीखेंगे कि वाक्यों को कैसे टोकनाइज़ करके अलग-अलग शब्दों में तोड़ा जाए। अंग्रेज़ी के लिए टोकनाइज़ेशन आसान लगता है, लेकिन जापानी जैसी भाषाएँ अंग्रेज़ी की तरह लगातार डिलिमिटेड नहीं होतीं, इसलिए वहाँ यह कठिन हो सकता है.
इस अभ्यास के लिए आपको दो डेटासेट दिए गए हैं: en_text और fr_text। en_text में अंग्रेज़ी वाक्यों की सूची है, और fr_text में उन्हीं के अनुरूप फ़्रेंच वाक्यों की सूची है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Keras के साथ Machine Translation
अभ्यास निर्देश
- एक
zip()फंक्शन लिखें जो अंग्रेज़ी (en_text) और फ़्रेंच (fr_text) की पहली 5 पंक्तियों/वाक्यों पर एक साथ इटेरेट करे. en_textसे पहला अंग्रेज़ी वाक्य लें.- प्राप्त वाक्य को space कैरेक्टर के आधार पर
split()फंक्शन से टोकनाइज़ करें और परिणामfirst_wordsमें असाइन करें. - टोकनाइज़ किए गए शब्द प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Iterate through the first 5 English and French sentences in the dataset
for en_sent, fr_sent in zip(____, ____):
print("English: ", en_sent)
print("\tFrench: ", fr_sent)
# Get the first sentence of the English dataset
first_sent = ____[____]
print("First sentence: ", first_sent)
# Tokenize the first sentence
____ = ____.____(____)
# Print the tokenized words
print("\tWords: ", ____)