Визуализация важности признаков
В этом упражнении вы определите, какие признаки оказались наиболее значимыми по оценке регрессора случайного леса rf, обученного в предыдущем упражнении.
Для этого вы построите горизонтальную столбчатую диаграмму важности признаков на основе данных из rf. Сделать это несложно — воспользуемся возможностями визуализации библиотеки pandas.
Мы уже создали объект pandas.Series под названием importances, в котором имена признаков хранятся в качестве index, а их значения важности — в качестве значений. Кроме того, matplotlib.pyplot доступен как plt, а pandas — как pd.
Это упражнение является частью курса
Машинное обучение на основе древовидных моделей в Python
Инструкции к упражнению
Вызовите метод
.sort_values()на объектеimportancesи сохраните результат в переменнуюimportances_sorted.Вызовите метод
.plot()на объектеimportances_sortedи задайте следующие аргументы:kindсо значением'barh'colorсо значением'lightgreen'
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a pd.Series of features importances
importances = pd.Series(data=rf.feature_importances_,
index= X_train.columns)
# Sort importances
importances_sorted = ____
# Draw a horizontal barplot of importances_sorted
____.____(____='____', ____='____')
plt.title('Features Importances')
plt.show()