Базовый классификатор на основе логистической регрессии
В двух последних уроках вы убедились, насколько важен отбор признаков в контексте собеседований по машинному обучению. Ещё одна распространённая тема, которую стоит ожидать на таком собеседовании, — это проектирование признаков и его влияние на качество модели.
В этом упражнении вы создадите новый признак на основе набора данных loan_data из главы 1, а затем сравните точность моделей логистической регрессии до и после проектирования признаков — сопоставив метки тестовой выборки с предсказанными значениями целевой переменной Loan Status.
Все необходимые пакеты уже импортированы: matplotlib.pyplot как plt, seaborn как sns, LogisticRegression из sklearn.linear_model, train_test_split из sklearn.model_selection и accuracy_score из sklearn.metrics.
Проектирование признаков — это шаг предобработки данных перед построением модели:

Это упражнение является частью курса
Практика вопросов интервью по машинному обучению на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]
# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)
# Instantiate
logistic = ____()
# Fit
logistic.____(____, ____)
# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))