Teknik multikolinieritas - rekayasa fitur
Multikolinieritas adalah masalah umum yang dapat memengaruhi kinerja Anda dalam konteks Machine Learning apa pun. Mengetahui cara membahas detail kecil ini dapat meningkatkan penjelasan pemodelan Anda dari baik menjadi sangat baik dan benar-benar membedakan Anda saat wawancara.
Dalam latihan ini, Anda akan berlatih membuat model dasar menggunakan Linear Regression pada himpunan data diabetes dan menelusuri beberapa metrik keluarannya. Lalu Anda akan mempraktikkan teknik untuk menelusuri korelasi antar variabel independen secara visual sebelum akhirnya melakukan rekayasa fitur pada 2 variabel yang berkorelasi sangat tinggi.
Untuk dua langkah pertama, gunakan X_train, X_test, y_train, dan y_test yang telah diimpor ke ruang kerja Anda.
Selain itu, semua paket yang relevan telah diimpor untuk Anda:
pandas sebagai pd, train_test_split dari sklearn.model_selection, LinearRegression dari sklearn.linear_model, mean_squared_error dan r2_score dari sklearn.metrics, matplotlib.pyplot sebagai plt, dan seaborn sebagai sns.
Latihan ini merupakan bagian dari kursus
Berlatih Pertanyaan Wawancara Machine Learning dengan Python
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))