Chọn bộ dữ liệu tối ưu
Bây giờ hãy loại bỏ một số đặc trưng không cần thiết trong bộ dữ liệu ufo. Vì cột country đã được mã hóa thành country_enc, bạn có thể giữ cột này và loại bỏ các cột khác liên quan đến vị trí: city, country, lat, long, và state.
Bạn đã tạo thêm các cột month và year, nên không còn cần date hoặc recorded nữa. Bạn cũng đã chuẩn hóa cột seconds thành seconds_log, vì vậy có thể bỏ seconds và minutes.
Bạn đã vector hóa desc, nên có thể xóa cột này. Tạm thời bạn sẽ giữ type.
Bạn cũng có thể bỏ cột length_of_time, vốn không cần thiết sau khi đã trích xuất minutes.
Bài tập này là một phần của khóa học
Tiền xử lý cho Machine Learning bằng Python
Hướng dẫn bài tập
- Tạo danh sách tất cả các cột cần loại bỏ,
to_drop. - Loại bỏ các cột này khỏi
ufo. - Dùng hàm
words_to_filter()mà bạn đã tạo trước đó; truyền vàovocab,vec.vocabulary_,desc_tfidf, và giữ4từ hàng đầu làm tham số cuối cùng.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)