НачатьНачать бесплатно

Выбор оптимального набора данных

Теперь удалим лишние признаки из набора данных ufo. Поскольку столбец country был закодирован как country_enc, его можно оставить, а остальные столбцы, связанные с местоположением, удалить: city, country, lat, long и state.

Вы создали столбцы month и year, поэтому столбцы date и recorded больше не нужны. Столбец seconds был стандартизирован как seconds_log, так что seconds и minutes можно удалить.

Столбец desc был векторизован, поэтому его тоже можно убрать. Столбец type пока оставим.

Также удалите столбец length_of_time — он стал ненужным после извлечения значения minutes.

Это упражнение является частью курса

Предобработка данных для машинного обучения на Python

Посмотреть курс

Инструкции к упражнению

  • Составьте список всех столбцов для удаления — to_drop.
  • Удалите эти столбцы из ufo.
  • Используйте функцию words_to_filter(), созданную ранее: передайте в неё vocab, vec.vocabulary_, desc_tfidf и укажите 4 в качестве последнего параметра — максимального числа слов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Make a list of features to drop
to_drop = [____]

# Drop those features
ufo_dropped = ufo.____

# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)
Редактировать и запускать код