Inizia subitoInizia gratis

Metodi filter e wrapper

Domande sulla riduzione della dimensionalità di un insieme di dati sono molto comuni nei colloqui di Machine Learning. Un modo per ridurre la dimensionalità è selezionare solo le feature rilevanti nel tuo insieme di dati.

Qui metterai in pratica un metodo filter sul DataFrame diabetes, seguito da 2 diversi stili di metodi wrapper che includono la cross-validation. Userai pandas, matplotlib.pyplot e seaborn per visualizzare le correlazioni, processare i dati e applicare tecniche di selezione delle feature al tuo insieme di dati.

La matrice delle feature con la colonna della variabile target rimossa (progression) è caricata come X, mentre la variabile target è caricata come y.

Tieni presente che pandas, matplotlib.pyplot e seaborn sono già stati importati nel tuo workspace e rinominati rispettivamente come pd, plt e sns.

Nota che hai aggiunto un passaggio di Cross-validate alla tua pipeline (che si applica agli ultimi 3 passaggi):

Pipeline di machine learning

Questo esercizio fa parte del corso

Esercitarsi con le domande di colloquio di Machine Learning in Python

Visualizza corso

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
Modifica ed esegui il codice