ÎncepețiÎncepe gratuit

Selecția caracteristicilor

În procesul de pregătire a datelor pentru modelare, este important să te asiguri că dispui de un set de caracteristici utile pe care modelul să își bazeze predicțiile (sau diagnosticul). Pentru a fi utile, caracteristicile trebuie să surprindă aspectele esențiale ale setului de date privind bolile cardiace într-un mod ortogonal – mai multe date nu înseamnă întotdeauna rezultate mai bune!

Poți folosi modulul sklearn.feature_selection.SelectFromModel pentru a selecta caracteristicile relevante. SelectFromModel implementează o metodă exhaustivă care utilizează un model RandomForestClassifier pentru a identifica cele mai importante caracteristici în sarcina de diagnosticare a bolilor cardiace.

RandomForestClassifier a fost deja importat, iar caracteristicile și variabila țintă din setul de date privind bolile cardiace au fost importate ca X_train, respectiv y_train.

Acest exercițiu face parte din cursul

Machine Learning End-to-End

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from sklearn.feature_selection import SelectFromModel

# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)
Editează și rulează codul