ПочатиПочніть безкоштовно

Сортування важливих ознак

Серед іншого, дерева рішень дуже популярні завдяки своїй інтерпретованості. Багато моделей дають точні прогнози, але дерева рішень також уміють кількісно оцінювати вплив різних ознак на ціль. Тут вони можуть підказати, які ознаки мають найсильніший і найслабший вплив на рішення звільнитися з компанії. У sklearn цю інформацію можна отримати через атрибут feature_importances_.

У цій вправі ви отримаєте кількісну важливість кожної ознаки, збережете її в датафреймі pandas (таблиці в стилі Python) і відсортуєте від найважливішої до менш важливої. Класифікатор дерева рішень model_ best, використаний у попередніх вправах, доступний у вашому робочому середовищі, так само як і змінні features_test та features_train.

pandas вже імпортовано як pd.

Ця вправа є частиною курсу

HR Analytics: прогнозування плинності персоналу в Python

Переглянути курс

Інструкції до вправи

  • Використайте атрибут feature_importances_, щоб обчислити відносні важливості ознак
  • Створіть список ознак
  • Збережіть результати в DataFrame за допомогою функції DataFrame(), де ознаки — це рядки, а їхні відповідні значення — це стовпець
  • Відсортуйте DataFrame relative_importances, щоб найважливіші ознаки були зверху, використовуючи функцію sort_values(), і виведіть результат

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Calculate feature importances
feature_importances = model_best.____

# Create a list of features: done
feature_list = list(features)

# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])

# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)
Редагувати та запускати код