Správa slovníku pomocí Tokenizeru
Pojďme se podívat blíže na fungování Tokenizeru. V tomto cvičení se naučíš, jak převést libovolnou větu na sekvenci pomocí natrénovaného Tokenizeru. Zároveň se naučíš ovládat velikost slovníku Tokenizeru. Prozkoumáš také, co se stane se slovy mimo slovník (OOV), když omezíš jeho velikost.
Pro toto cvičení máš k dispozici Tokenizer en_tok, který jsi implementoval/a dříve. Tokenizer je již naimportován.
Toto cvičení je součástí kurzu
Machine Translation with Keras
Pokyny k cvičení
- Převeď následující větu na sekvenci pomocí předchozího
Tokenizeruen_tok:she likes grapefruit , peaches , and lemons . - Vytvoř nový
Tokenizeren_tok_news velikostí slovníku 50 a slovem pro výrazy mimo slovníkUNK. - Natrénuj nový tokenizer na datech
en_text. - Převeď větu
she likes grapefruit , peaches , and lemons .na sekvenci pomocíen_tok_new.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)
# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)
# Fit the tokenizer on en_text
en_tok_new.____(____)
# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])