시작하기무료로 시작하기

신용 데이터 원-핫 인코딩

이제 비수치형 열을 LogisticRegression() 모델에 넣을 수 있도록 준비해 볼까요?

원-핫 인코딩으로 새 열을 만든 뒤, 수치형 열과 이어 붙여서 이후 수업 전체에서 부도 확률을 예측하는 데 사용할 새 데이터 프레임을 만들어요.

반드시 비수치형 열만 원-핫 인코딩하세요. 수치형 열까지 인코딩하면 데이터가 지나치게 넓어집니다!

신용 대출 데이터 cr_loan_clean은 작업 공간에 이미 로드되어 있어요.

이 연습은 강의의 일부입니다

Python으로 배우는 신용 리스크 모델링

강의 보기

연습 안내

  • 모든 수치형 열로 구성된 데이터 세트 cred_num과 비수치형 열로 구성된 데이터 세트 cred_str를 만드세요.
  • cred_str에 원-핫 인코딩을 적용해 cred_str_onehot이라는 새 데이터 세트를 만드세요.
  • cred_num과 새로 원-핫 인코딩된 데이터를 합쳐 결과를 cr_loan_prep에 저장하세요.
  • 새 데이터 세트의 열 이름을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])

# One-hot encode the non-numeric columns
____ = pd.____(____)

# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)

# Print the columns in the new data set
print(____.columns)
코드 편집 및 실행