ПочатиПочніть безкоштовно

Вибір оптимального набору даних

Тепер приберімо зайві ознаки з набору даних ufo. Оскільки стовпець country було закодовано як country_enc, ви можете лишити його, а інші стовпці, пов'язані з місцем розташування, видалити: city, country, lat, long та state.

Ви створили інженерні ознаки month і year, тож стовпці date і recorded більше не потрібні. Ви також стандартизували стовпець seconds як seconds_log, отже можна видалити seconds і minutes.

Ви векторизували desc, тож його можна прибрати. Поки що type залишаємо.

Також можна позбутися стовпця length_of_time, який зайвий після виокремлення minutes.

Ця вправа є частиною курсу

Передобробка для машинного навчання в Python

Переглянути курс

Інструкції до вправи

  • Створіть список усіх стовпців для видалення to_drop.
  • Видаліть ці стовпці з ufo.
  • Використайте функцію words_to_filter(), яку ви створили раніше; передайте vocab, vec.vocabulary_, desc_tfidf і як останній параметр залиште топ 4 слова.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Make a list of features to drop
to_drop = [____]

# Drop those features
ufo_dropped = ufo.____

# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)
Редагувати та запускати код