Tách dữ liệu huấn luyện và kiểm định
Bạn sẽ tạo các tập dữ liệu huấn luyện và kiểm định. Giữ một tập kiểm định và theo dõi hiệu năng của mô hình trên tập này là một thực hành tốt để tránh hiện tượng overfitting.
Trong bài tập này, bạn được cung cấp en_text (các câu tiếng Anh) và fr_text (các câu tiếng Pháp).
Bài tập này là một phần của khóa học
Machine Translation với Keras
Hướng dẫn bài tập
- Tạo một dãy chỉ số bằng
np.arange(), bắt đầu từ 0 và có kích thước bằngen_text. - Định nghĩa
train_indslàtrain_sizechỉ số đầu tiên trong dãy chỉ số này. - Tạo
tr_envàtf_fr, chứa các câu tại các chỉ số được chỉ định bởitrain_indstrong các danh sáchen_textvàfr_text. - Tạo
v_envàv_fr, chứa các câu tại các chỉ số được chỉ định bởivalid_indstrong các danh sáchen_textvàfr_text.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
train_size, valid_size = 800, 200
# Define a sequence of indices from 0 to size of en_text
inds = np.____(len(____))
np.random.shuffle(inds)
# Define train_inds as first train_size indices
train_inds = inds[:____]
valid_inds = inds[train_size:train_size+valid_size]
# Define tr_en (train EN sentences) and tr_fr (train FR sentences)
tr_en = [en_text[ti] for ti in ____]
tr_fr = [____[____] for ti in ____]
# Define v_en (valid EN sentences) and v_fr (valid FR sentences)
v_en = [en_text[____] for vi in ____]
v_fr = [____[____] for vi in ____]
print('Training (EN):\n', tr_en[:3], '\nTraining (FR):\n', tr_fr[:3])
print('\nValid (EN):\n', v_en[:3], '\nValid (FR):\n', v_fr[:3])