Klasifikator baseline Logistic Regression
Dalam 2 pelajaran terakhir, Anda mempelajari betapa berharganya pemilihan fitur dalam konteks wawancara Machine Learning. Satu set pertanyaan umum lainnya yang perlu Anda antisipasi berkaitan dengan rekayasa fitur, dan bagaimana hal tersebut membantu meningkatkan kinerja model.
Pada latihan ini, Anda akan merekayasa sebuah fitur baru pada himpunan data loan_data dari Bab 1, lalu membandingkan skor akurasi model Logistic Regression pada himpunan data sebelum dan sesudah rekayasa fitur dengan membandingkan label uji dengan nilai prediksi dari variabel target Loan Status.
Semua paket yang relevan telah diimpor untuk Anda: matplotlib.pyplot sebagai plt, seaborn sebagai sns, LogisticRegression dari sklearn.linear_model, train_test_split dari sklearn.model_selection, dan accuracy_score dari sklearn.metrics.
Rekayasa fitur dianggap sebagai langkah pra-pemrosesan sebelum pemodelan:

Latihan ini merupakan bagian dari kursus
Berlatih Pertanyaan Wawancara Machine Learning dengan Python
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]
# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)
# Instantiate
logistic = ____()
# Fit
logistic.____(____, ____)
# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))