Bắt đầu ngayBắt đầu miễn phí

Tiền xử lý với Keras

Mô-đun quan trọng thứ hai của Keras là keras.preprocessing. Bạn sẽ thấy cách dùng những mô-đun và hàm quan trọng nhất để chuẩn bị dữ liệu thô về đúng dạng đầu vào. Keras cung cấp các chức năng thay thế cách tiếp cận dùng từ điển mà bạn đã học trước đó.

Bạn sẽ dùng mô-đun keras.preprocessing.text.Tokenizer để tạo một từ điển từ bằng phương thức .fit_on_texts() và chuyển văn bản thành các id số đại diện cho chỉ mục của từng từ trong từ điển bằng phương thức .texts_to_sequences().

Sau đó, dùng hàm .pad_sequences() từ keras.preprocessing.sequence để cho tất cả các chuỗi có cùng kích thước (cần thiết cho mô hình) bằng cách thêm số 0 vào các văn bản ngắn và cắt bớt các văn bản dài.

Bài tập này là một phần của khóa học

Mạng nơ-ron hồi quy (RNN) cho Mô hình ngôn ngữ với Keras

Xem khóa học

Hướng dẫn bài tập

  • Import Tokenizerpad_sequences từ các mô-đun tương ứng.
  • Fit đối tượng tokenizer trên dữ liệu mẫu lưu trong texts.
  • Biến đổi văn bản thành các chuỗi chỉ mục số bằng phương thức .texts_to_sequences().
  • Cố định độ dài văn bản bằng cách padding chúng.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import relevant classes/functions
from tensorflow.keras.preprocessing.text import ____
from tensorflow.keras.preprocessing.sequence import ____

# Build the dictionary of indexes
tokenizer = Tokenizer()
tokenizer.fit_on_texts(____)

# Change texts into sequence of indexes
texts_numeric = tokenizer.____(texts)
print("Number of words in the sample texts: ({0}, {1})".format(len(texts_numeric[0]), len(texts_numeric[1])))

# Pad the sequences
texts_pad = ____(texts_numeric, 60)
print("Now the texts have fixed length: 60. Let's see the first one: \n{0}".format(texts_pad[0]))
Chỉnh sửa và Chạy Mã