CommencezCommencez gratuitement

Votre première pipeline — encore une fois!

De retour à la jeune pousse en arythmie, votre revue mensuelle approche et, dans ce cadre, une experte ou un expert en programmation Python passera votre code en revue. Vous décidez de faire le ménage en suivant les pratiques exemplaires et de remplacer votre script de sélection de caractéristiques et de classification par forêt aléatoire par une pipeline. Vous utilisez un jeu d'entraînement accessible sous X_train et y_train, ainsi que plusieurs modules : RandomForestClassifier, SelectKBest() et f_classif() pour la sélection de caractéristiques, ainsi que GridSearchCV et Pipeline.

Cette activité fait partie du cours

Concevoir des flux de travail Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Créez une pipeline avec le sélecteur de caractéristiques fourni dans l'exemple de code, et un classificateur par forêt aléatoire. Nommez la première étape feature_selection.
  • Ajoutez deux paires clé-valeur dans params : une pour le nombre de caractéristiques k dans le sélecteur avec les valeurs 10 et 20, et une pour n_estimators dans la forêt avec les valeurs possibles 2 et 5.
  • Initialisez un objet GridSearchCV avec la pipeline et la grille de paramètres données.
  • Ajustez l'objet aux données et affichez la meilleure combinaison de paramètres.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create pipeline with feature selector and classifier
pipe = ___([
    (___, SelectKBest(f_classif)),
    ('clf', ___(random_state=2))])

# Create a parameter grid
params = {
   'feature_selection__k':___,
    ___:[2, 5]}

# Initialize the grid search object
grid_search = ___(___, ___=params)

# Fit it to the data and print the best value combination
print(grid_search.fit(___, ___).___)
Modifier et exécuter le code