Bắt đầu ngayBắt đầu miễn phí

Phân loại văn bản bằng vector tf/idf

Bây giờ khi bạn đã mã hóa cột title của bộ dữ liệu volunteer thành các vector tf/idf, bạn sẽ dùng các vector này để dự đoán cột category_desc.

Bài tập này là một phần của khóa học

Tiền xử lý cho Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Chia vector text_tfidf và biến mục tiêu y thành tập huấn luyện và tập kiểm tra, đặt tham số stratify bằng y vì phân bố lớp không đồng đều. Lưu ý rằng chúng ta phải chạy phương thức .toarray() trên vector tf/idf để đưa nó về đúng định dạng cho scikit-learn.
  • Fit dữ liệu X_trainy_train vào mô hình Naive Bayes, nb.
  • In độ chính xác trên tập kiểm tra.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)

# Fit the model to the training data
nb.____(____, ____)

# Print out the model's accuracy
print(nb.____(____, ____))
Chỉnh sửa và Chạy Mã