НачатьНачать бесплатно

Базовый классификатор на основе логистической регрессии

В двух последних уроках вы убедились, насколько важен отбор признаков в контексте собеседований по машинному обучению. Ещё одна распространённая тема, которую стоит ожидать на таком собеседовании, — это проектирование признаков и его влияние на качество модели.

В этом упражнении вы создадите новый признак на основе набора данных loan_data из главы 1, а затем сравните точность моделей логистической регрессии до и после проектирования признаков — сопоставив метки тестовой выборки с предсказанными значениями целевой переменной Loan Status.

Все необходимые пакеты уже импортированы: matplotlib.pyplot как plt, seaborn как sns, LogisticRegression из sklearn.linear_model, train_test_split из sklearn.model_selection и accuracy_score из sklearn.metrics.

Проектирование признаков — это шаг предобработки данных перед построением модели: Machine learning pipeline

Это упражнение является частью курса

Практика вопросов интервью по машинному обучению на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)

# Instantiate
logistic = ____()

# Fit
logistic.____(____, ____)

# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))
Редактировать и запускать код