НачатьНачать бесплатно

Разделение данных на обучающую и валидационную выборки

В этом упражнении вы создадите обучающую и валидационную выборки. Использование валидационной выборки и отслеживание качества модели на ней — хорошая практика, помогающая избежать переобучения.

Для выполнения упражнения вам предоставлены en_text (предложения на английском) и fr_text (предложения на французском).

Это упражнение является частью курса

Машинный перевод с Keras

Посмотреть курс

Инструкции к упражнению

  • Определите последовательность индексов с помощью np.arange(), начиная с 0, размером равным длине en_text.
  • Определите train_inds как первые train_size индексов из этой последовательности.
  • Определите tr_en и tf_fr — списки предложений, соответствующих индексам из train_inds, взятых из списков en_text и fr_text.
  • Определите v_en и v_fr — списки предложений, соответствующих индексам из valid_inds, взятых из списков en_text и fr_text.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

train_size, valid_size = 800, 200
# Define a sequence of indices from 0 to size of en_text
inds = np.____(len(____))
np.random.shuffle(inds)
# Define train_inds as first train_size indices
train_inds = inds[:____]
valid_inds = inds[train_size:train_size+valid_size]
# Define tr_en (train EN sentences) and tr_fr (train FR sentences)
tr_en = [en_text[ti] for ti in ____]
tr_fr = [____[____] for ti in ____]
# Define v_en (valid EN sentences) and v_fr (valid FR sentences)
v_en = [en_text[____] for vi in ____]
v_fr = [____[____] for vi in ____]
print('Training (EN):\n', tr_en[:3], '\nTraining (FR):\n', tr_fr[:3])
print('\nValid (EN):\n', v_en[:3], '\nValid (FR):\n', v_fr[:3])
Редактировать и запускать код