Вибір оптимального набору даних
Тепер приберімо зайві ознаки з набору даних ufo. Оскільки стовпець country було закодовано як country_enc, ви можете лишити його, а інші стовпці, пов'язані з місцем розташування, видалити: city, country, lat, long та state.
Ви створили інженерні ознаки month і year, тож стовпці date і recorded більше не потрібні. Ви також стандартизували стовпець seconds як seconds_log, отже можна видалити seconds і minutes.
Ви векторизували desc, тож його можна прибрати. Поки що type залишаємо.
Також можна позбутися стовпця length_of_time, який зайвий після виокремлення minutes.
Ця вправа є частиною курсу
Передобробка для машинного навчання в Python
Інструкції до вправи
- Створіть список усіх стовпців для видалення
to_drop. - Видаліть ці стовпці з
ufo. - Використайте функцію
words_to_filter(), яку ви створили раніше; передайтеvocab,vec.vocabulary_,desc_tfidfі як останній параметр залиште топ4слова.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)