Metode de filtrare și de tip wrapper
Întrebările despre reducerea dimensionalității unui set de date sunt foarte frecvente în interviurile de machine learning. O modalitate de a reduce dimensionalitatea este să selectezi doar caracteristicile relevante din setul tău de date.
Aici vei exersa o metodă de filtrare aplicată pe DataFrame-ul diabetes, urmată de 2 stiluri diferite de metode wrapper care includ validare încrucișată. Vei folosi pandas, matplotlib.pyplot și seaborn pentru a vizualiza corelații, a procesa datele și a aplica tehnici de selecție a caracteristicilor.
Matricea de caracteristici cu coloana variabilei țintă eliminată (progression) este încărcată ca X, iar variabila țintă este încărcată ca y.
Reține că pandas, matplotlib.pyplot și seaborn au fost deja importate în spațiul tău de lucru și au alias-urile pd, plt, respectiv sns.
Observă că ai adăugat un pas de validare încrucișată în pipeline-ul tău (care se aplică ultimilor 3 pași):

Acest exercițiu face parte din cursul
Exersează întrebări de interviu pentru Machine Learning în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)