ПочатиПочніть безкоштовно

Керування словником за допомогою Tokenizer

Давайте детальніше розглянемо роботу Tokenizer. У цій вправі ви навчитеся перетворювати довільне речення на послідовність за допомогою вже натренованого Tokenizer. Крім того, ви дізнаєтеся, як керувати розміром словника Tokenizer. Ви також дослідите, що відбувається зі словами поза словником (OOV), коли ви обмежуєте розмір словника Tokenizer.

Для цієї вправи вам надано Tokenizer en_tok, який ви реалізували раніше. Tokenizer вже імпортовано для вас.

Ця вправа є частиною курсу

Machine Translation з Keras

Переглянути курс

Інструкції до вправи

  • Перетворіть таке речення на послідовність за допомогою попереднього Tokenizer en_tok: she likes grapefruit , peaches , and lemons .
  • Створіть новий Tokenizer, en_tok_new, із розміром словника 50 та словом поза словником UNK.
  • Навчіть новий tokenizer на даних en_text.
  • Перетворіть речення she likes grapefruit , peaches , and lemons . на послідовність за допомогою en_tok_new.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)

# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)

# Fit the tokenizer on en_text
en_tok_new.____(____)

# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])
Редагувати та запускати код