Tiền xử lý dữ liệu
Bạn đã học về những khác biệt khi tiền xử lý dữ liệu cho bài toán phân loại đa lớp. Hãy áp dụng vào thực hành bằng cách tiền xử lý dữ liệu để chuẩn bị tạo một mô hình phân loại đa lớp đơn giản.
Bộ dữ liệu đã được nạp vào biến news_dataset, và có các thuộc tính sau:
news_dataset.data: mảng chứa văn bảnnews_dataset.target: mảng chứa các danh mục mục tiêu dưới dạng chỉ số số
Dữ liệu mẫu gồm 5.000 quan sát.
Bài tập này là một phần của khóa học
Mạng nơ-ron hồi quy (RNN) cho Mô hình ngôn ngữ với Keras
Hướng dẫn bài tập
- Khởi tạo lớp
Tokenizervào biếntokenizer. - Fit biến
tokenizertrên dữ liệu văn bản. - Dùng phương thức
.texts_to_sequences()trên dữ liệu văn bản. - Dùng hàm
to_categorical()để chuẩn bị các chỉ số mục tiêu.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create and fit tokenizer
tokenizer = ____
tokenizer.fit_on_texts(____)
# Prepare the data
prep_data = tokenizer.____(news_dataset.data)
prep_data = pad_sequences(prep_data, maxlen=200)
# Prepare the labels
target_labels = to_categorical(____)
# Print the shapes
print(prep_data.shape)
print(target_labels.shape)