Phân loại văn bản bằng vector tf/idf
Bây giờ khi bạn đã mã hóa cột title của bộ dữ liệu volunteer thành các vector tf/idf, bạn sẽ dùng các vector này để dự đoán cột category_desc.
Bài tập này là một phần của khóa học
Tiền xử lý cho Machine Learning bằng Python
Hướng dẫn bài tập
- Chia vector
text_tfidfvà biến mục tiêuythành tập huấn luyện và tập kiểm tra, đặt tham sốstratifybằngyvì phân bố lớp không đồng đều. Lưu ý rằng chúng ta phải chạy phương thức.toarray()trên vector tf/idf để đưa nó về đúng định dạng cho scikit-learn. - Fit dữ liệu
X_trainvày_trainvào mô hình Naive Bayes,nb. - In độ chính xác trên tập kiểm tra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Split the dataset according to the class distribution of category_desc
y = volunteer["category_desc"]
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____=____, random_state=42)
# Fit the model to the training data
nb.____(____, ____)
# Print out the model's accuracy
print(nb.____(____, ____))