Metodi filter e wrapper
Domande sulla riduzione della dimensionalità di un insieme di dati sono molto comuni nei colloqui di Machine Learning. Un modo per ridurre la dimensionalità è selezionare solo le feature rilevanti nel tuo insieme di dati.
Qui metterai in pratica un metodo filter sul DataFrame diabetes, seguito da 2 diversi stili di metodi wrapper che includono la cross-validation. Userai pandas, matplotlib.pyplot e seaborn per visualizzare le correlazioni, processare i dati e applicare tecniche di selezione delle feature al tuo insieme di dati.
La matrice delle feature con la colonna della variabile target rimossa (progression) è caricata come X, mentre la variabile target è caricata come y.
Tieni presente che pandas, matplotlib.pyplot e seaborn sono già stati importati nel tuo workspace e rinominati rispettivamente come pd, plt e sns.
Nota che hai aggiunto un passaggio di Cross-validate alla tua pipeline (che si applica agli ultimi 3 passaggi):

Questo esercizio fa parte del corso
Esercitarsi con le domande di colloquio di Machine Learning in Python
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)