Керування словником за допомогою Tokenizer
Давайте детальніше розглянемо роботу Tokenizer. У цій вправі ви навчитеся перетворювати довільне речення на послідовність за допомогою вже натренованого Tokenizer. Крім того, ви дізнаєтеся, як керувати розміром словника Tokenizer. Ви також дослідите, що відбувається зі словами поза словником (OOV), коли ви обмежуєте розмір словника Tokenizer.
Для цієї вправи вам надано Tokenizer en_tok, який ви реалізували раніше. Tokenizer вже імпортовано для вас.
Ця вправа є частиною курсу
Machine Translation з Keras
Інструкції до вправи
- Перетворіть таке речення на послідовність за допомогою попереднього Tokenizer
en_tok:she likes grapefruit , peaches , and lemons . - Створіть новий
Tokenizer,en_tok_new, із розміром словника 50 та словом поза словникомUNK. - Навчіть новий tokenizer на даних
en_text. - Перетворіть речення
she likes grapefruit , peaches , and lemons .на послідовність за допомогоюen_tok_new.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)
# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)
# Fit the tokenizer on en_text
en_tok_new.____(____)
# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])