Mô hình hóa bộ dữ liệu UFO, phần 2
Cuối cùng, bạn sẽ xây dựng một mô hình sử dụng vector văn bản mà chúng ta đã tạo, desc_tfidf, và dùng danh sách filtered_words để tạo một vector văn bản đã lọc. Hãy xem bạn có thể dự đoán type của lần nhìn thấy dựa trên văn bản hay không. Bạn sẽ dùng mô hình Naive Bayes cho bài này.
Bài tập này là một phần của khóa học
Tiền xử lý cho Machine Learning bằng Python
Hướng dẫn bài tập
- Lọc vector
desc_tfidfbằng cách truyền một danh sáchfiltered_wordsvào chỉ mục. - Chia các đặc trưng
filtered_textvày, đảm bảo phân bố lớp cân bằng giữa các tập huấn luyện và kiểm tra; dùngrandom_statelà42. - Dùng
.fit()của mô hìnhnbđể huấn luyệnX_trainvày_train. - In ra
.score()của mô hìnhnbtrên các tậpX_testvày_test.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]
# Split the X and y sets using train_test_split, setting stratify=y
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)
# Fit nb to the training sets
____
# Print the score of nb on the test sets
____