Tokenize câu với Keras
Ở đây bạn sẽ trực tiếp làm việc với Tokenizer của Keras. Tokenizer là một tiện ích rất hữu ích giúp bạn xử lý văn bản quan trọng chỉ với vài dòng mã. Ví dụ, Tokenizer có thể tự động ánh xạ các từ trong vốn từ vựng của bạn sang ID chỉ với một lần gọi hàm. Tại đây, bạn sẽ tìm hiểu chi tiết hơn về điều này.
Bạn sẽ tạo một đối tượng Tokenizer của Keras và fit nó trên một số văn bản, từ đó Tokenizer xây dựng một từ điển các từ và ID tương ứng. Văn bản dùng để huấn luyện Tokenizer được lấy từ Udacity Github Repo.
Bài tập này là một phần của khóa học
Machine Translation với Keras
Hướng dẫn bài tập
- Định nghĩa một đối tượng Keras Tokenizer.
- Fit tokenizer trên
en_text. - Lấy ID của từng từ
wtrong danh sách["january", "apples", "summer"]. - In ra từ và ID tương ứng của nó.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from tensorflow.keras.preprocessing.text import Tokenizer
# Define a Keras Tokenizer
en_tok = ____
# Fit the tokenizer on some text
en_tok.____(____)
for w in ["january", "apples", "summer"]:
# Get the word ID of word w
id = en_tok.____[____]
# Print the word and the word ID
print(____, " has id: ", _____)