Začněte nyníZačněte zdarma

Rozdělení dat na trénovací a validační sadu

Vytvoříš trénovací a validační datové sady. Udržovat validační sadu a sledovat výkon modelu na ní je dobrá praxe, jak předejít overfittingu.

Pro toto cvičení máš k dispozici en_text (anglické věty) a fr_text (francouzské věty).

Toto cvičení je součástí kurzu

Machine Translation with Keras

Zobrazit kurz

Pokyny k cvičení

  • Definuj posloupnost indexů pomocí np.arange(), která začíná od 0 a má velikost en_text.
  • Definuj train_inds jako prvních train_size indexů z této posloupnosti.
  • Definuj tr_en a tf_fr, které obsahují věty na indexech určených proměnnou train_inds ze seznamů en_text a fr_text.
  • Definuj v_en a v_fr, které obsahují věty na indexech určených proměnnou valid_inds ze seznamů en_text a fr_text.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

train_size, valid_size = 800, 200
# Define a sequence of indices from 0 to size of en_text
inds = np.____(len(____))
np.random.shuffle(inds)
# Define train_inds as first train_size indices
train_inds = inds[:____]
valid_inds = inds[train_size:train_size+valid_size]
# Define tr_en (train EN sentences) and tr_fr (train FR sentences)
tr_en = [en_text[ti] for ti in ____]
tr_fr = [____[____] for ti in ____]
# Define v_en (valid EN sentences) and v_fr (valid FR sentences)
v_en = [en_text[____] for vi in ____]
v_fr = [____[____] for vi in ____]
print('Training (EN):\n', tr_en[:3], '\nTraining (FR):\n', tr_fr[:3])
print('\nValid (EN):\n', v_en[:3], '\nValid (FR):\n', v_fr[:3])
Upravit a spustit kód