НачатьНачать бесплатно

Сортировка важных признаков

Деревья решений пользуются большой популярностью, в том числе благодаря своей интерпретируемости. Многие модели способны давать точные прогнозы, однако деревья решений позволяют ещё и количественно оценить влияние каждого признака на целевую переменную. В данном случае модель покажет, какие признаки сильнее всего влияют на решение сотрудника покинуть компанию, а какие — почти не оказывают воздействия. В sklearn эту информацию можно получить с помощью атрибута feature_importances_.

В этом упражнении вы вычислите количественную значимость каждого признака, сохраните результаты в DataFrame библиотеки pandas и отсортируете их от наиболее важных к наименее важным. Классификатор на основе дерева решений model_best, использованный в предыдущих упражнениях, доступен в вашем рабочем пространстве, как и переменные features_test и features_train.

Библиотека pandas импортирована как pd.

Это упражнение является частью курса

HR-аналитика: прогнозирование текучести кадров на Python

Посмотреть курс

Инструкции к упражнению

  • Используйте атрибут feature_importances_, чтобы вычислить относительную значимость признаков.
  • Создайте список признаков.
  • Сохраните результаты в DataFrame с помощью функции DataFrame(), где признаки будут строками, а их значения — столбцом.
  • Отсортируйте DataFrame relative_importances, чтобы наиболее важные признаки оказались вверху, используя функцию sort_values(), и выведите результат.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Calculate feature importances
feature_importances = model_best.____

# Create a list of features: done
feature_list = list(features)

# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])

# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)
Редактировать и запускать код