Сортировка важных признаков
Деревья решений пользуются большой популярностью, в том числе благодаря своей интерпретируемости. Многие модели способны давать точные прогнозы, однако деревья решений позволяют ещё и количественно оценить влияние каждого признака на целевую переменную. В данном случае модель покажет, какие признаки сильнее всего влияют на решение сотрудника покинуть компанию, а какие — почти не оказывают воздействия. В sklearn эту информацию можно получить с помощью атрибута feature_importances_.
В этом упражнении вы вычислите количественную значимость каждого признака, сохраните результаты в DataFrame библиотеки pandas и отсортируете их от наиболее важных к наименее важным. Классификатор на основе дерева решений model_best, использованный в предыдущих упражнениях, доступен в вашем рабочем пространстве, как и переменные features_test и features_train.
Библиотека pandas импортирована как pd.
Это упражнение является частью курса
HR-аналитика: прогнозирование текучести кадров на Python
Инструкции к упражнению
- Используйте атрибут
feature_importances_, чтобы вычислить относительную значимость признаков. - Создайте список признаков.
- Сохраните результаты в DataFrame с помощью функции
DataFrame(), где признаки будут строками, а их значения — столбцом. - Отсортируйте DataFrame
relative_importances, чтобы наиболее важные признаки оказались вверху, используя функциюsort_values(), и выведите результат.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Calculate feature importances
feature_importances = model_best.____
# Create a list of features: done
feature_list = list(features)
# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])
# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)