Bắt đầu ngayBắt đầu miễn phí

Tiền xử lý dữ liệu

Bạn đã học về những khác biệt khi tiền xử lý dữ liệu cho bài toán phân loại đa lớp. Hãy áp dụng vào thực hành bằng cách tiền xử lý dữ liệu để chuẩn bị tạo một mô hình phân loại đa lớp đơn giản.

Bộ dữ liệu đã được nạp vào biến news_dataset, và có các thuộc tính sau:

  • news_dataset.data: mảng chứa văn bản
  • news_dataset.target: mảng chứa các danh mục mục tiêu dưới dạng chỉ số số

Dữ liệu mẫu gồm 5.000 quan sát.

Bài tập này là một phần của khóa học

Mạng nơ-ron hồi quy (RNN) cho Mô hình ngôn ngữ với Keras

Xem khóa học

Hướng dẫn bài tập

  • Khởi tạo lớp Tokenizer vào biến tokenizer.
  • Fit biến tokenizer trên dữ liệu văn bản.
  • Dùng phương thức .texts_to_sequences() trên dữ liệu văn bản.
  • Dùng hàm to_categorical() để chuẩn bị các chỉ số mục tiêu.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)

# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)

# Prepare the labels
target_labels = to_categorical(____)

# Print the shapes
print(prep_data.shape)
print(target_labels.shape)
Chỉnh sửa và Chạy Mã