Mulai sekarangMulai gratis

Metode filter dan wrapper

Pertanyaan tentang mengurangi dimensi himpunan data sangat umum dalam wawancara Machine Learning. Salah satu cara mengurangi dimensi adalah dengan hanya memilih fitur yang relevan dalam himpunan data Anda.

Di sini Anda akan mempraktikkan metode filter pada DataFrame diabetes, diikuti 2 gaya metode wrapper berbeda yang mencakup cross-validation. Anda akan menggunakan pandas, matplotlib.pyplot, dan seaborn untuk memvisualisasikan korelasi, memproses data, dan menerapkan teknik seleksi fitur pada himpunan data Anda.

Matriks fitur dengan kolom variabel target (progression) yang telah dihapus dimuat sebagai X, sedangkan variabel target dimuat sebagai y.

Perhatikan bahwa pandas, matplotlib.pyplot, dan seaborn sudah diimpor ke workspace Anda dan masing-masing dialias sebagai pd, plt, dan sns.

Perhatikan Anda telah menambahkan langkah Cross-validate ke pipeline Anda (yang berlaku untuk 3 langkah terakhir):

Machine learning pipeline

Latihan ini merupakan bagian dari kursus

Berlatih Pertanyaan Wawancara Machine Learning dengan Python

Lihat Kursus

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
Edit dan Jalankan Kode