누락된 신용 데이터 대체하기
이제 누락된 데이터를 확인해 보세요. loan_status에 누락값이 있으면 해당 대출이 부도였는지 알 수 없기 때문에 부도 확률을 예측하는 데 이 데이터를 사용할 수 없습니다. person_emp_length의 누락값은 그 정도로 치명적이진 않지만, 여전히 학습 시 오류를 유발할 수 있습니다.
따라서 person_emp_length 열의 누락된 데이터를 확인하고, 누락값이 있으면 중앙값으로 대체하세요.
데이터 세트 cr_loan은 작업 공간에 로드되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 신용 리스크 모델링
연습 안내
.isnull()을 사용해 누락값이 있는 열 이름 배열을 출력하세요.person_emp_length에 누락값이 있는 데이터의 상위 5개 행을 출력하세요..fillna()를 사용해 모든 재직 기간의 중앙값으로 누락값을 대체하세요.- 분포를 확인하기 위해
person_emp_length열의 히스토그램을 생성하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Print a null value column array
print(____.columns[____.____().any()])
# Print the top five rows with nulls for employment length
print(____[____[____].____()].head())
# Impute the null values with the median value for all employment lengths
____[____].____((cr_loan['person_emp_length'].____()), inplace=True)
# Create a histogram of employment length
n, bins, patches = plt.____(____[____], bins='auto', color='blue')
plt.xlabel("Person Employment Length")
plt.____()