Управление словарём с помощью Tokenizer
Рассмотрим работу Tokenizer подробнее. В этом упражнении вы научитесь преобразовывать произвольное предложение в последовательность с помощью обученного Tokenizer, а также управлять размером его словаря. Кроме того, вы изучите, что происходит со словами вне словаря (OOV), когда размер словаря Tokenizer ограничен.
Для этого упражнения вам предоставлен Tokenizer en_tok, реализованный ранее. Tokenizer уже импортирован.
Это упражнение является частью курса
Машинный перевод с Keras
Инструкции к упражнению
- Преобразуйте следующее предложение в последовательность с помощью имеющегося
Tokenizeren_tok:she likes grapefruit , peaches , and lemons . - Создайте новый
Tokenizeren_tok_newс размером словаря 50 и токеном для слов вне словаряUNK. - Обучите новый токенизатор на данных
en_text. - Преобразуйте предложение
she likes grapefruit , peaches , and lemons .в последовательность с помощьюen_tok_new.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)
# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)
# Fit the tokenizer on en_text
en_tok_new.____(____)
# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])