शुरू करेंमुफ़्त में शुरू करें

भाग 2: डेटासेट का अन्वेषण

अब आप डेटासेट के कुछ गुणों का अन्वेषण करेंगे. खास तौर पर, आप सभी वाक्यों की औसत लंबाई (अर्थात् शब्दों की संख्या) और English डेटासेट के vocabulary का आकार निर्धारित करेंगे.

इस अभ्यास के लिए English डेटासेट en_text, जिसमें English वाक्यों की एक लिस्ट है, उपलब्ध कराया गया है. इस अभ्यास में आप Python की लिस्ट-संबंधित फंक्शन <list>.extend() का उपयोग करेंगे, जो <list>.append() फंक्शन का एक अलग वैरिएंट है. इसे एक उदाहरण से समझते हैं. मान लीजिए a=[1,2,3] और b=[4,5]. a.append(b) का परिणाम लिस्ट [1,2,3,[4,5]] होगा, जबकि a.extend(b) का परिणाम [1,2,3,4,5] होगा.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Keras के साथ Machine Translation

पाठ्यक्रम देखें

अभ्यास निर्देश

  • en_text पर इटरेट करते हुए split() और len() फंक्शन का उपयोग करके प्रत्येक वाक्य की लंबाई निकालें.
  • numpy का उपयोग करके वाक्यों की mean लंबाई निकालें.
  • for लूप के बॉडी में, टोकनाइज़ करने के बाद वाक्यों में पाए गए सभी शब्द जोड़कर लिस्ट all_words को भरें.
  • लिस्ट all_words को set ऑब्जेक्ट में बदलें और उस set की लंबाई/साइज़ निकालें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Compute length of sentences
sent_lengths = [len(____.____(____)) for en_sent in ____]
# Compute the mean of sentences lengths
mean_length = np.____(____)
print('(English) Mean sentence length: ', mean_length)

all_words = []
for sent in en_text:
  # Populate all_words with all the words in sentences
  all_words.____(____.____(____))
# Compute the length of the set containing all_words
vocab_size = len(____(____))
print("(English) Vocabulary size: ", vocab_size)
कोड संपादित करें और चलाएँ