Výběr příznaků
Při přípravě dat pro modelování je důležité zajistit, aby měl model k dispozici sadu užitečných příznaků, na jejichž základě bude provádět předpovědi (nebo diagnózy). Aby byly příznaky skutečně užitečné, musí zachycovat podstatné charakteristiky datasetu srdečních onemocnění ortogonálním způsobem – více dat totiž není vždy lepší!
K výběru užitečných příznaků můžeš použít modul sklearn.feature_selection.SelectFromModel. SelectFromModel implementuje hrubou silou metodu, která využívá model RandomForestClassifier k nalezení nejvýznamnějších příznaků pro úlohu diagnostiky srdečních onemocnění.
RandomForestClassifier je již naimportován a příznaky i cílová proměnná datasetu srdečních onemocnění jsou dostupné jako X_train, respektive y_train.
Toto cvičení je součástí kurzu
Strojové učení od začátku do konce
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)