Сортування важливих ознак
Серед іншого, дерева рішень дуже популярні завдяки своїй інтерпретованості. Багато моделей дають точні прогнози, але дерева рішень також уміють кількісно оцінювати вплив різних ознак на ціль. Тут вони можуть підказати, які ознаки мають найсильніший і найслабший вплив на рішення звільнитися з компанії. У sklearn цю інформацію можна отримати через атрибут feature_importances_.
У цій вправі ви отримаєте кількісну важливість кожної ознаки, збережете її в датафреймі pandas (таблиці в стилі Python) і відсортуєте від найважливішої до менш важливої. Класифікатор дерева рішень model_ best, використаний у попередніх вправах, доступний у вашому робочому середовищі, так само як і змінні features_test та features_train.
pandas вже імпортовано як pd.
Ця вправа є частиною курсу
HR Analytics: прогнозування плинності персоналу в Python
Інструкції до вправи
- Використайте атрибут
feature_importances_, щоб обчислити відносні важливості ознак - Створіть список ознак
- Збережіть результати в DataFrame за допомогою функції
DataFrame(), де ознаки — це рядки, а їхні відповідні значення — це стовпець - Відсортуйте DataFrame
relative_importances, щоб найважливіші ознаки були зверху, використовуючи функціюsort_values(), і виведіть результат
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Calculate feature importances
feature_importances = model_best.____
# Create a list of features: done
feature_list = list(features)
# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])
# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)