Sélection de caractéristiques
Lorsque vous préparez vos données pour l'entraînement d'un modèle, il est important de vous assurer que vous disposez d'un ensemble de caractéristiques pertinentes sur lesquelles le modèle pourra s'appuyer pour ses prédictions (ou son diagnostic). Pour être utiles, les caractéristiques doivent saisir les éléments essentiels du jeu de données sur les maladies cardiaques de façon orthogonale; plus de données n'est pas toujours mieux!
Vous pouvez utiliser le module sklearn.feature_selection.SelectFromModel pour sélectionner des caractéristiques pertinentes. SelectFromModel met en œuvre une méthode par force brute qui utilise un modèle RandomForestClassifier pour repérer les caractéristiques les plus saillantes pour la tâche de diagnostic des maladies cardiaques.
RandomForestClassifier a été importé et les caractéristiques et la cible du jeu de données sur les maladies cardiaques ont été importées sous les noms X_train et y_train, respectivement.
Cette activité fait partie du cours
Apprentissage Machine de bout en bout
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)