로지스틱 회귀 기준 분류기
직전 2개 레슨에서 Machine Learning 인터뷰 맥락에서 특징 선택이 얼마나 중요한지 살펴봤어요. 인터뷰에서 자주 나오는 또 다른 주제는 특징 공학이며, 이것이 모델 성능 향상에 어떻게 도움이 되는지에 관한 질문입니다.
이 연습 문제에서는 1장에서 사용한 loan_data 데이터셋에 새 특징을 만들고, 특징 공학 전후의 데이터셋에 대해 로지스틱 회귀 모델의 정확도를 비교해 봅니다. 테스트 레이블과 타깃 변수 Loan Status의 예측값을 비교해 정확도를 계산하세요.
필요한 패키지는 모두 임포트되어 있습니다: matplotlib.pyplot은 plt, seaborn은 sns, sklearn.linear_model의 LogisticRegression, sklearn.model_selection의 train_test_split, sklearn.metrics의 accuracy_score.
특징 공학은 모델링 전에 수행하는 전처리 단계로 간주됩니다:

이 연습은 강의의 일부입니다
Python으로 연습하는 Machine Learning 면접 질문
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create X matrix and y array
X = loan_data.____("____", axis=1)
y = loan_data["____"]
# Train/test split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=123)
# Instantiate
logistic = ____()
# Fit
logistic.____(____, ____)
# Predict and print accuracy
print(____(y_true=____, y_pred=logistic.____(____)))