ÎncepețiÎncepe gratuit

Metode de filtrare și de tip wrapper

Întrebările despre reducerea dimensionalității unui set de date sunt foarte frecvente în interviurile de machine learning. O modalitate de a reduce dimensionalitatea este să selectezi doar caracteristicile relevante din setul tău de date.

Aici vei exersa o metodă de filtrare aplicată pe DataFrame-ul diabetes, urmată de 2 stiluri diferite de metode wrapper care includ validare încrucișată. Vei folosi pandas, matplotlib.pyplot și seaborn pentru a vizualiza corelații, a procesa datele și a aplica tehnici de selecție a caracteristicilor.

Matricea de caracteristici cu coloana variabilei țintă eliminată (progression) este încărcată ca X, iar variabila țintă este încărcată ca y.

Reține că pandas, matplotlib.pyplot și seaborn au fost deja importate în spațiul tău de lucru și au alias-urile pd, plt, respectiv sns.

Observă că ai adăugat un pas de validare încrucișată în pipeline-ul tău (care se aplică ultimilor 3 pași):

Machine learning pipeline

Acest exercițiu face parte din cursul

Exersează întrebări de interviu pentru Machine Learning în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
Editează și rulează codul