Selecția caracteristicilor
În procesul de pregătire a datelor pentru modelare, este important să te asiguri că dispui de un set de caracteristici utile pe care modelul să își bazeze predicțiile (sau diagnosticul). Pentru a fi utile, caracteristicile trebuie să surprindă aspectele esențiale ale setului de date privind bolile cardiace într-un mod ortogonal – mai multe date nu înseamnă întotdeauna rezultate mai bune!
Poți folosi modulul sklearn.feature_selection.SelectFromModel pentru a selecta caracteristicile relevante. SelectFromModel implementează o metodă exhaustivă care utilizează un model RandomForestClassifier pentru a identifica cele mai importante caracteristici în sarcina de diagnosticare a bolilor cardiace.
RandomForestClassifier a fost deja importat, iar caracteristicile și variabila țintă din setul de date privind bolile cardiace au fost importate ca X_train, respectiv y_train.
Acest exercițiu face parte din cursul
Machine Learning End-to-End
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)