Отбор признаков
При подготовке данных к моделированию важно убедиться, что модель располагает набором информативных признаков, на основе которых она будет строить прогнозы (или ставить диагнозы). Чтобы признак был полезным, он должен отражать существенные характеристики набора данных о сердечных заболеваниях — причём независимым образом: больше данных не всегда лучше!
Для отбора полезных признаков можно использовать модуль sklearn.feature_selection.SelectFromModel. SelectFromModel реализует метод перебора, применяя модель RandomForestClassifier, чтобы найти наиболее значимые признаки для задачи диагностики сердечных заболеваний.
RandomForestClassifier уже импортирован, а признаки и целевая переменная набора данных о сердечных заболеваниях загружены как X_train и y_train соответственно.
Это упражнение является частью курса
Сквозное машинное обучение
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)