신용 데이터 원-핫 인코딩
이제 비수치형 열을 LogisticRegression() 모델에 넣을 수 있도록 준비해 볼까요?
원-핫 인코딩으로 새 열을 만든 뒤, 수치형 열과 이어 붙여서 이후 수업 전체에서 부도 확률을 예측하는 데 사용할 새 데이터 프레임을 만들어요.
반드시 비수치형 열만 원-핫 인코딩하세요. 수치형 열까지 인코딩하면 데이터가 지나치게 넓어집니다!
신용 대출 데이터 cr_loan_clean은 작업 공간에 이미 로드되어 있어요.
이 연습은 강의의 일부입니다
Python으로 배우는 신용 리스크 모델링
연습 안내
- 모든 수치형 열로 구성된 데이터 세트
cred_num과 비수치형 열로 구성된 데이터 세트cred_str를 만드세요. cred_str에 원-핫 인코딩을 적용해cred_str_onehot이라는 새 데이터 세트를 만드세요.cred_num과 새로 원-핫 인코딩된 데이터를 합쳐 결과를cr_loan_prep에 저장하세요.- 새 데이터 세트의 열 이름을 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)