НачатьНачать бесплатно

Управление словарём с помощью Tokenizer

Рассмотрим работу Tokenizer подробнее. В этом упражнении вы научитесь преобразовывать произвольное предложение в последовательность с помощью обученного Tokenizer, а также управлять размером его словаря. Кроме того, вы изучите, что происходит со словами вне словаря (OOV), когда размер словаря Tokenizer ограничен.

Для этого упражнения вам предоставлен Tokenizer en_tok, реализованный ранее. Tokenizer уже импортирован.

Это упражнение является частью курса

Машинный перевод с Keras

Посмотреть курс

Инструкции к упражнению

  • Преобразуйте следующее предложение в последовательность с помощью имеющегося Tokenizer en_tok: she likes grapefruit , peaches , and lemons .
  • Создайте новый Tokenizer en_tok_new с размером словаря 50 и токеном для слов вне словаря UNK.
  • Обучите новый токенизатор на данных en_text.
  • Преобразуйте предложение she likes grapefruit , peaches , and lemons . в последовательность с помощью en_tok_new.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)

# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)

# Fit the tokenizer on en_text
en_tok_new.____(____)

# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])
Редактировать и запускать код