시작하기무료로 시작하기

결과 변수 값의 분포

훈련용과 테스트용 데이터셋을 생성할 때 결과 변수로 층화(stratify)하면, 두 데이터셋에서 결과 변수 값의 분포 범위가 비슷해지도록 보장할 수 있어요.

원본 데이터를 무작위로 분할하면, 예를 들어 home_sales의 비싼 주택이 모두 테스트 데이터셋에만 들어가는 상황을 층화로 방지할 수 있습니다. 이런 경우 모델은 상대적으로 저가 주택으로만 학습되어 성능이 떨어질 가능성이 큽니다.

이번 연습에서는 훈련용과 테스트용 데이터셋에서 selling_price 변수의 요약 통계를 계산하겠습니다. home_traininghome_test 티블은 이전 연습 문제에서 불러온 상태예요.

이 연습은 강의의 일부입니다

R에서 tidymodels로 모델링하기

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Distribution of selling_price in training data
___ %>% 
  summarize(min_sell_price = ___,
            max_sell_price = ___,
            mean_sell_price = ___,
            sd_sell_price = ___)
코드 편집 및 실행