НачатьНачать бесплатно

Визуализация важности признаков

В этом упражнении вы определите, какие признаки оказались наиболее значимыми по оценке регрессора случайного леса rf, обученного в предыдущем упражнении.

Для этого вы построите горизонтальную столбчатую диаграмму важности признаков на основе данных из rf. Сделать это несложно — воспользуемся возможностями визуализации библиотеки pandas.

Мы уже создали объект pandas.Series под названием importances, в котором имена признаков хранятся в качестве index, а их значения важности — в качестве значений. Кроме того, matplotlib.pyplot доступен как plt, а pandas — как pd.

Это упражнение является частью курса

Машинное обучение на основе древовидных моделей в Python

Посмотреть курс

Инструкции к упражнению

  • Вызовите метод .sort_values() на объекте importances и сохраните результат в переменную importances_sorted.

  • Вызовите метод .plot() на объекте importances_sorted и задайте следующие аргументы:

    • kind со значением 'barh'
    • color со значением 'lightgreen'

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a pd.Series of features importances
importances = pd.Series(data=rf.feature_importances_,
                        index= X_train.columns)

# Sort importances
importances_sorted = ____

# Draw a horizontal barplot of importances_sorted
____.____(____='____', ____='____')
plt.title('Features Importances')
plt.show()
Редактировать и запускать код