시작하기무료로 시작하기

Train and testing transformations (II)

학습 세트와 테스트 세트에 같은 스케일러를 적용하는 것과 마찬가지로, 학습 세트에서 이상치를 제거했다면 테스트 세트에도 동일하게 적용해야 해요. 이때도 마찬가지로 테스트 세트의 이상치를 제거할 때는 반드시 학습 세트에서만 계산한 임계값 을 사용해야 합니다.

이전 연습 문제와 유사하게, so_numeric_df DataFrame을 학습(so_train_numeric)과 테스트(so_test_numeric) 세트로 분할해 두었습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Machine Learning 특성 공학

강의 보기

연습 안내

  • ConvertedSalary 열의 표준편차와 평균을 계산하세요.
  • 평균에서 양방향으로 표준편차 세 배만큼 떨어진 값을 하한과 상한으로 계산하세요.
  • ConvertedSalary가 하한과 상한 사이에 있는 행만 유지하도록 so_test_numeric DataFrame을 잘라내세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____

cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off

# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
                             & (so_test_numeric['ConvertedSalary'] > ____)]
코드 편집 및 실행