Začněte nyníZačněte zdarma

Správa slovníku pomocí Tokenizeru

Pojďme se podívat blíže na fungování Tokenizeru. V tomto cvičení se naučíš, jak převést libovolnou větu na sekvenci pomocí natrénovaného Tokenizeru. Zároveň se naučíš ovládat velikost slovníku Tokenizeru. Prozkoumáš také, co se stane se slovy mimo slovník (OOV), když omezíš jeho velikost.

Pro toto cvičení máš k dispozici Tokenizer en_tok, který jsi implementoval/a dříve. Tokenizer je již naimportován.

Toto cvičení je součástí kurzu

Machine Translation with Keras

Zobrazit kurz

Pokyny k cvičení

  • Převeď následující větu na sekvenci pomocí předchozího Tokenizeru en_tok: she likes grapefruit , peaches , and lemons .
  • Vytvoř nový Tokenizer en_tok_new s velikostí slovníku 50 a slovem pro výrazy mimo slovník UNK.
  • Natrénuj nový tokenizer na datech en_text.
  • Převeď větu she likes grapefruit , peaches , and lemons . na sekvenci pomocí en_tok_new.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)

# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)

# Fit the tokenizer on en_text
en_tok_new.____(____)

# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])
Upravit a spustit kód