CommencezCommencez gratuitement

Méthodes filtre et enveloppe

Les questions sur la réduction de la dimensionnalité d'un jeu de données sont très courantes lors d'entrevues en Machine Learning. Une façon d'y parvenir consiste à ne sélectionner que les caractéristiques pertinentes dans votre jeu de données.

Ici, vous allez pratiquer une méthode filtre sur le DataFrame diabetes, puis deux variantes de méthodes enveloppe qui incluent la validation croisée. Vous utiliserez pandas, matplotlib.pyplot et seaborn pour visualiser les corrélations, traiter vos données et appliquer des techniques de sélection de caractéristiques à votre jeu de données.

La matrice de caractéristiques dont la colonne de la variable cible (progression) a été retirée est chargée dans X, tandis que la variable cible est chargée dans y.

Notez que pandas, matplotlib.pyplot et seaborn ont déjà été importés dans votre espace de travail et renommés respectivement pd, plt et sns.

Remarquez que vous avez ajouté une étape de validation croisée à votre pipeline (qui s'applique aux 3 dernières étapes) :

Pipeline de Machine Learning

Cette activité fait partie du cours

S'exercer aux questions d'entrevue en Machine Learning avec Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
Modifier et exécuter le code