시작하기무료로 시작하기

누락된 신용 데이터 대체하기

이제 누락된 데이터를 확인해 보세요. loan_status에 누락값이 있으면 해당 대출이 부도였는지 알 수 없기 때문에 부도 확률을 예측하는 데 이 데이터를 사용할 수 없습니다. person_emp_length의 누락값은 그 정도로 치명적이진 않지만, 여전히 학습 시 오류를 유발할 수 있습니다.

따라서 person_emp_length 열의 누락된 데이터를 확인하고, 누락값이 있으면 중앙값으로 대체하세요.

데이터 세트 cr_loan은 작업 공간에 로드되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 신용 리스크 모델링

강의 보기

연습 안내

  • .isnull()을 사용해 누락값이 있는 열 이름 배열을 출력하세요.
  • person_emp_length에 누락값이 있는 데이터의 상위 5개 행을 출력하세요.
  • .fillna()를 사용해 모든 재직 기간의 중앙값으로 누락값을 대체하세요.
  • 분포를 확인하기 위해 person_emp_length 열의 히스토그램을 생성하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Print a null value column array
print(____.columns[____.____().any()])

# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())

# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)

# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()
코드 편집 및 실행