시작하기무료로 시작하기

다중공선성 기법 - 피처 엔지니어링

다중공선성은 어떤 Machine Learning 맥락에서도 성능에 영향을 줄 수 있는 흔한 이슈입니다. 이 작은 부분을 어떻게 설명하는지에 따라 모델링 설명이 한층 탄탄해지고, 면접에서도 차별화될 수 있어요.

이 연습 문제에서는 diabetes 데이터셋에 대해 Linear Regression을 사용해 기준(baseline) 모델을 만들고, 일부 출력 지표를 살펴보겠습니다. 이어서 독립 변수들 간의 상관관계를 시각적으로 탐색하는 방법을 연습한 다음, 서로 높은 상관을 보이는 변수 2개를 대상으로 피처 엔지니어링을 수행해 보겠습니다.

처음 두 단계에서는 워크스페이스에 이미 불러온 X_train, X_test, y_train, 그리고 y_test를 사용하세요.

또한 필요한 패키지는 모두 가져와 두었습니다: pandaspd, sklearn.model_selectiontrain_test_split, sklearn.linear_modelLinearRegression, sklearn.metricsmean_squared_errorr2_score, matplotlib.pyplotplt, seabornsns로 임포트되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 연습하는 Machine Learning 면접 질문

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
코드 편집 및 실행