Bắt đầu ngayBắt đầu miễn phí

Mô hình hóa bộ dữ liệu UFO, phần 2

Cuối cùng, bạn sẽ xây dựng một mô hình sử dụng vector văn bản mà chúng ta đã tạo, desc_tfidf, và dùng danh sách filtered_words để tạo một vector văn bản đã lọc. Hãy xem bạn có thể dự đoán type của lần nhìn thấy dựa trên văn bản hay không. Bạn sẽ dùng mô hình Naive Bayes cho bài này.

Bài tập này là một phần của khóa học

Tiền xử lý cho Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Lọc vector desc_tfidf bằng cách truyền một danh sách filtered_words vào chỉ mục.
  • Chia các đặc trưng filtered_texty, đảm bảo phân bố lớp cân bằng giữa các tập huấn luyện và kiểm tra; dùng random_state42.
  • Dùng .fit() của mô hình nb để huấn luyện X_trainy_train.
  • In ra .score() của mô hình nb trên các tập X_testy_test.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Use the list of filtered words we created to filter the text vector
filtered_text = ____[:, list(____)]

# Split the X and y sets using train_test_split, setting stratify=y 
X_train, X_test, y_train, y_test = ____(____.toarray(), ____, ____, random_state=42)

# Fit nb to the training sets
____

# Print the score of nb on the test sets
____
Chỉnh sửa và Chạy Mã