Bắt đầu ngayBắt đầu miễn phí

Tách dữ liệu huấn luyện và kiểm định

Bạn sẽ tạo các tập dữ liệu huấn luyện và kiểm định. Giữ một tập kiểm định và theo dõi hiệu năng của mô hình trên tập này là một thực hành tốt để tránh hiện tượng overfitting.

Trong bài tập này, bạn được cung cấp en_text (các câu tiếng Anh) và fr_text (các câu tiếng Pháp).

Bài tập này là một phần của khóa học

Machine Translation với Keras

Xem khóa học

Hướng dẫn bài tập

  • Tạo một dãy chỉ số bằng np.arange(), bắt đầu từ 0 và có kích thước bằng en_text.
  • Định nghĩa train_indstrain_size chỉ số đầu tiên trong dãy chỉ số này.
  • Tạo tr_entf_fr, chứa các câu tại các chỉ số được chỉ định bởi train_inds trong các danh sách en_textfr_text.
  • Tạo v_env_fr, chứa các câu tại các chỉ số được chỉ định bởi valid_inds trong các danh sách en_textfr_text.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

train_size, valid_size = 800, 200
# Define a sequence of indices from 0 to size of en_text
inds = np.____(len(____))
np.random.shuffle(inds)
# Define train_inds as first train_size indices
train_inds = inds[:____]
valid_inds = inds[train_size:train_size+valid_size]
# Define tr_en (train EN sentences) and tr_fr (train FR sentences)
tr_en = [en_text[ti] for ti in ____]
tr_fr = [____[____] for ti in ____]
# Define v_en (valid EN sentences) and v_fr (valid FR sentences)
v_en = [en_text[____] for vi in ____]
v_fr = [____[____] for vi in ____]
print('Training (EN):\n', tr_en[:3], '\nTraining (FR):\n', tr_fr[:3])
print('\nValid (EN):\n', v_en[:3], '\nValid (FR):\n', v_fr[:3])
Chỉnh sửa và Chạy Mã