로그와 거듭제곱 변환
이전 연습 문제에서는 loan_data의 학습용 데이터셋과 테스트 데이터셋 분포를 비교했어요. Machine Learning 면접에서는 특히 중요합니다. 관측된 분포에 따라, 정규성 가정을 위배하지 않도록 특징 분포를 정규 분포에 가깝게 만드는 변환 기법이 필요한지 판단해야 하기 때문이에요.
이번 연습 문제에서는 scipy.stats 모듈의 로그 및 거듭제곱(Box-Cox) 변환을 loan_data의 Years of Credit History 특징에 적용하고, seaborn의 distplot() 함수로 분포와 커널 밀도 추정(kde)을 함께 시각화해 볼 거예요.
필요한 패키지는 모두 임포트되어 있어요.
현재 파이프라인에서의 위치는 다음과 같아요:

이 연습은 강의의 일부입니다
Python으로 연습하는 Machine Learning 면접 질문
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Subset loan_data
cr_yrs = ____['____']
# Histogram and kernel density estimate
plt.figure()
sns.____(____)
plt.show()