शुरू करेंमुफ़्त में शुरू करें

प्रशिक्षण और वैलिडेशन डेटा को विभाजित करना

आप प्रशिक्षण और वैलिडेशन डेटासेट बनाएँगे। वैलिडेशन डेटासेट अलग रखना और उस पर मॉडल के परफॉर्मेंस की निगरानी करना, overfitting से बचने के लिए एक अच्छी प्रैक्टिस है।

इस अभ्यास के लिए आपको en_text (अंग्रेज़ी वाक्य) और fr_text (फ़्रेंच वाक्य) दिए गए हैं।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Keras के साथ Machine Translation

पाठ्यक्रम देखें

अभ्यास निर्देश

  • np.arange() का उपयोग करके 0 से शुरू होने वाला, en_text के आकार जितना इंडेक्स क्रम परिभाषित करें.
  • train_inds को उस इंडेक्स क्रम से पहले train_size इंडेक्सों के रूप में परिभाषित करें.
  • tr_en और tf_fr परिभाषित करें, जिनमें क्रमशः en_text और fr_text सूचियों में train_inds द्वारा दिए गए इंडेक्सों पर पाए गए वाक्य हों.
  • v_en और v_fr परिभाषित करें, जिनमें क्रमशः en_text और fr_text सूचियों में valid_inds द्वारा दिए गए इंडेक्सों पर पाए गए वाक्य हों.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

train_size, valid_size = 800, 200
# Define a sequence of indices from 0 to size of en_text
inds = np.____(len(____))
np.random.shuffle(inds)
# Define train_inds as first train_size indices
train_inds = inds[:____]
valid_inds = inds[train_size:train_size+valid_size]
# Define tr_en (train EN sentences) and tr_fr (train FR sentences)
tr_en = [en_text[ti] for ti in ____]
tr_fr = [____[____] for ti in ____]
# Define v_en (valid EN sentences) and v_fr (valid FR sentences)
v_en = [en_text[____] for vi in ____]
v_fr = [____[____] for vi in ____]
print('Training (EN):\n', tr_en[:3], '\nTraining (FR):\n', tr_fr[:3])
print('\nValid (EN):\n', v_en[:3], '\nValid (FR):\n', v_fr[:3])
कोड संपादित करें और चलाएँ