Särdragsurval
När du förbereder dina data för modellering är det viktigt att se till att modellen har tillgång till relevanta särdrag att basera sina prediktioner (eller diagnoser) på. För att vara användbara behöver särdragen fånga väsentliga egenskaper i hjärtsjukdomsdatasetet på ett ortogonalt sätt – mer data är inte alltid bättre!
Du kan använda modulen sklearn.feature_selection.SelectFromModel för att välja ut användbara särdrag. SelectFromModel implementerar en brute-force-metod som använder en RandomForestClassifier-modell för att hitta de mest relevanta särdragen för uppgiften att diagnostisera hjärtsjukdom.
RandomForestClassifier har importerats och hjärtsjukdomsdatatsets särdrag och målvariabel har importerats som X_train respektive y_train.
Den här övningen är en del av kursen
End-to-End Machine Learning
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)