전처리
이제 본격적으로 Feature engineering을 해 볼 시간이에요! 관측 ID처럼 정보력이 낮지만 잠재적으로 유용할 수 있는 변수를 처리하고, 결측값도 다뤄야 해요. 또한 일부 예측 변수를 변환할 기회이기도 해요. 예를 들어, 수치형 특성은 정규화하고 범주형 특성은 더미 변수를 만들어 보세요.
이전 연습 문제에서 생성한 attrition 데이터셋과 train 및 test 분할이 환경에 준비되어 있어요.
이 연습은 강의의 일부입니다
R로 배우는 Feature Engineering
연습 안내
- 모든 수치형 특성을 정규화하세요.
knn대치 알고리즘을 사용해 결측값을 대치하세요.- 모든 명목형 예측 변수에 대해 더미 변수를 생성하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
recipe <- recipe(Attrition ~ ., data = train) %>%
update_role(...1, new_role = "ID") %>%
# Normalize all numeric features
___(all_numeric_predictors()) %>%
# Impute missing values using the knn imputation algorithm
___(all_predictors()) %>%
# Create dummy variables for all nominal predictors
___(all_nominal_predictors())
recipe