Kiểm soát vốn từ với Tokenizer
Hãy đi sâu hơn một chút vào cách hoạt động của Tokenizer. Trong bài này, bạn sẽ học cách chuyển một câu bất kỳ thành một dãy số bằng Tokenizer đã được huấn luyện. Bên cạnh đó, bạn sẽ học cách kiểm soát kích thước vốn từ của Tokenizer. Bạn cũng sẽ khảo sát điều gì xảy ra với các từ ngoài từ vựng (OOV) khi bạn giới hạn kích thước vốn từ của một Tokenizer.
Trong bài này, bạn đã được cung cấp Tokenizer en_tok mà bạn đã triển khai trước đó. Tokenizer đã được import sẵn cho bạn.
Bài tập này là một phần của khóa học
Machine Translation với Keras
Hướng dẫn bài tập
- Chuyển câu sau thành một dãy số bằng
Tokenizeren_toktrước đó:she likes grapefruit , peaches , and lemons . - Tạo một
Tokenizermới,en_tok_newvới kích thước vốn từ là 50 và từ ngoài từ vựng làUNK. - Fit (huấn luyện) tokenizer mới trên dữ liệu
en_text. - Chuyển câu
she likes grapefruit , peaches , and lemons .thành một dãy số bằngen_tok_new.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)
# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)
# Fit the tokenizer on en_text
en_tok_new.____(____)
# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])