Méthodes filtre et enveloppe
Les questions sur la réduction de la dimensionnalité d'un jeu de données sont très courantes lors d'entrevues en Machine Learning. Une façon d'y parvenir consiste à ne sélectionner que les caractéristiques pertinentes dans votre jeu de données.
Ici, vous allez pratiquer une méthode filtre sur le DataFrame diabetes, puis deux variantes de méthodes enveloppe qui incluent la validation croisée. Vous utiliserez pandas, matplotlib.pyplot et seaborn pour visualiser les corrélations, traiter vos données et appliquer des techniques de sélection de caractéristiques à votre jeu de données.
La matrice de caractéristiques dont la colonne de la variable cible (progression) a été retirée est chargée dans X, tandis que la variable cible est chargée dans y.
Notez que pandas, matplotlib.pyplot et seaborn ont déjà été importés dans votre espace de travail et renommés respectivement pd, plt et sns.
Remarquez que vous avez ajouté une étape de validation croisée à votre pipeline (qui s'applique aux 3 dernières étapes) :

Cette activité fait partie du cours
S'exercer aux questions d'entrevue en Machine Learning avec Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)