Bắt đầu ngayBắt đầu miễn phí

Tokenize câu với Keras

Ở đây bạn sẽ trực tiếp làm việc với Tokenizer của Keras. Tokenizer là một tiện ích rất hữu ích giúp bạn xử lý văn bản quan trọng chỉ với vài dòng mã. Ví dụ, Tokenizer có thể tự động ánh xạ các từ trong vốn từ vựng của bạn sang ID chỉ với một lần gọi hàm. Tại đây, bạn sẽ tìm hiểu chi tiết hơn về điều này.

Bạn sẽ tạo một đối tượng Tokenizer của Keras và fit nó trên một số văn bản, từ đó Tokenizer xây dựng một từ điển các từ và ID tương ứng. Văn bản dùng để huấn luyện Tokenizer được lấy từ Udacity Github Repo.

Bài tập này là một phần của khóa học

Machine Translation với Keras

Xem khóa học

Hướng dẫn bài tập

  • Định nghĩa một đối tượng Keras Tokenizer.
  • Fit tokenizer trên en_text.
  • Lấy ID của từng từ w trong danh sách ["january", "apples", "summer"].
  • In ra từ và ID tương ứng của nó.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from tensorflow.keras.preprocessing.text import Tokenizer

# Define a Keras Tokenizer
en_tok = ____

# Fit the tokenizer on some text
en_tok.____(____)

for w in ["january", "apples", "summer"]:
  # Get the word ID of word w
  id = en_tok.____[____]
  # Print the word and the word ID
  print(____, " has id: ", _____)
Chỉnh sửa và Chạy Mã