Выбор оптимального набора данных
Теперь удалим лишние признаки из набора данных ufo. Поскольку столбец country был закодирован как country_enc, его можно оставить, а остальные столбцы, связанные с местоположением, удалить: city, country, lat, long и state.
Вы создали столбцы month и year, поэтому столбцы date и recorded больше не нужны. Столбец seconds был стандартизирован как seconds_log, так что seconds и minutes можно удалить.
Столбец desc был векторизован, поэтому его тоже можно убрать. Столбец type пока оставим.
Также удалите столбец length_of_time — он стал ненужным после извлечения значения minutes.
Это упражнение является частью курса
Предобработка данных для машинного обучения на Python
Инструкции к упражнению
- Составьте список всех столбцов для удаления —
to_drop. - Удалите эти столбцы из
ufo. - Используйте функцию
words_to_filter(), созданную ранее: передайте в неёvocab,vec.vocabulary_,desc_tfidfи укажите4в качестве последнего параметра — максимального числа слов.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Make a list of features to drop
to_drop = [____]
# Drop those features
ufo_dropped = ufo.____
# Let's also filter some words out of the text vector we created
filtered_words = ____(____, ____, ____, ____)