Selekcja cech
Przygotowując dane do modelowania, warto zadbać o to, by model dysponował zestawem przydatnych cech, na podstawie których będzie stawiać prognozy (lub diagnozy). Aby cechy były użyteczne, muszą uchwycić istotne właściwości zbioru danych o chorobach serca w sposób ortogonalny – więcej danych nie zawsze oznacza lepsze wyniki!
Do wyboru przydatnych cech możesz użyć modułu sklearn.feature_selection.SelectFromModel. SelectFromModel stosuje metodę siłową, która wykorzystuje model RandomForestClassifier do znalezienia najważniejszych cech potrzebnych do diagnozy chorób serca.
RandomForestClassifier został już zaimportowany, a cechy i etykiety zbioru danych o chorobach serca są dostępne odpowiednio jako X_train i y_train.
To ćwiczenie jest częścią kursu
End-to-End Machine Learning
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)