Bắt đầu ngayBắt đầu miễn phí

Chọn bộ dữ liệu tối ưu

Bây giờ hãy loại bỏ một số đặc trưng không cần thiết trong bộ dữ liệu ufo. Vì cột country đã được mã hóa thành country_enc, bạn có thể giữ cột này và loại bỏ các cột khác liên quan đến vị trí: city, country, lat, long, và state.

Bạn đã tạo thêm các cột monthyear, nên không còn cần date hoặc recorded nữa. Bạn cũng đã chuẩn hóa cột seconds thành seconds_log, vì vậy có thể bỏ secondsminutes.

Bạn đã vector hóa desc, nên có thể xóa cột này. Tạm thời bạn sẽ giữ type.

Bạn cũng có thể bỏ cột length_of_time, vốn không cần thiết sau khi đã trích xuất minutes.

Bài tập này là một phần của khóa học

Tiền xử lý cho Machine Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Tạo danh sách tất cả các cột cần loại bỏ, to_drop.
  • Loại bỏ các cột này khỏi ufo.
  • Dùng hàm words_to_filter() mà bạn đã tạo trước đó; truyền vào vocab, vec.vocabulary_, desc_tfidf, và giữ 4 từ hàng đầu làm tham số cuối cùng.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Make a list of features to drop
to_drop = [____]

# Drop those features
ufo_dropped = ufo.____

# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)
Chỉnh sửa và Chạy Mã