히스토그램
데이터 세트 loan_data가 작업 공간에 로드되어 있어요. 앞에서는 CrossTable() 함수를 사용해 범주형 변수를 탐색했죠. 이제는 연속형 변수를 탐색해 잠재적인 이상치나 예상 밖의 데이터 구조를 찾으려고 합니다.
이를 위해 hist() 함수를 사용해 서로 다른 고객의 대출 건수 분포를 살펴보며 이해해 봅시다.
이 연습은 강의의 일부입니다
R로 배우는 신용 위험 모델링
연습 안내
- hist()를 사용해 인자를 하나만 주고 히스토그램을 그리세요:
loan_data$loan_amnt. 결과를hist_1이라는 새 객체에 할당하세요. - 히스토그램 구간 정보를 더 알아보려면 객체
hist_1과 함께$breaks를 사용하세요. 구간의 위치를 아는 것은 중요해요. 구간을 잘못 정하면 히스토그램이 오해를 부를 수 있기 때문입니다. breaks인자를 지정해hist_1의 구간 수를 200으로 바꾸세요. 추가로,xlab인자로 x축 이름을"Loan amount"로 지정하고,main인자로 제목을"Histogram of the loan amount"로 지정하세요. 결과를hist_2에 저장하세요. 봉우리가 해당 위치에 나타나는 이유는 무엇일까요?
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create histogram of loan_amnt: hist_1
# Print locations of the breaks in hist_1
# Change number of breaks and add labels: hist_2
hist_2 <- hist(loan_data$loan_amnt, breaks = ___, xlab = "___",
main = "___")