Bắt đầu ngayBắt đầu miễn phí

Kiểm soát vốn từ với Tokenizer

Hãy đi sâu hơn một chút vào cách hoạt động của Tokenizer. Trong bài này, bạn sẽ học cách chuyển một câu bất kỳ thành một dãy số bằng Tokenizer đã được huấn luyện. Bên cạnh đó, bạn sẽ học cách kiểm soát kích thước vốn từ của Tokenizer. Bạn cũng sẽ khảo sát điều gì xảy ra với các từ ngoài từ vựng (OOV) khi bạn giới hạn kích thước vốn từ của một Tokenizer.

Trong bài này, bạn đã được cung cấp Tokenizer en_tok mà bạn đã triển khai trước đó. Tokenizer đã được import sẵn cho bạn.

Bài tập này là một phần của khóa học

Machine Translation với Keras

Xem khóa học

Hướng dẫn bài tập

  • Chuyển câu sau thành một dãy số bằng Tokenizer en_tok trước đó: she likes grapefruit , peaches , and lemons .
  • Tạo một Tokenizer mới, en_tok_new với kích thước vốn từ là 50 và từ ngoài từ vựng là UNK.
  • Fit (huấn luyện) tokenizer mới trên dữ liệu en_text.
  • Chuyển câu she likes grapefruit , peaches , and lemons . thành một dãy số bằng en_tok_new.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Convert the sentence to a word ID sequence
seq = ____.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence: ', seq)

# Define a tokenizer with vocabulary size 50 and oov_token 'UNK'
en_tok_new = ____(num_words=____, ____=____)

# Fit the tokenizer on en_text
en_tok_new.____(____)

# Convert the sentence to a word ID sequence
seq_new = en_tok_new.____(['she likes grapefruit , peaches , and lemons .'])
print('Word ID sequence (with UNK): ', seq_new)
print('The ID 1 represents the word: ', en_tok_new.index_word[1])
Chỉnh sửa và Chạy Mã