전체 랜덤 포레스트 모델 만들기
Random forest 모델은 많은 하위 트리를 특징의 무작위 부분집합에서 생성하므로 자연스럽게 특징 선택을 수행해요. 특징 중요도를 이해하는 한 가지 방법은 모델을 만든 다음 특징 중요도를 추출하는 거예요. 이번 연습에서는 Healthcare Job Attrition 데이터를 사용해 특징 중요도를 추출할 수 있는 rand_forest() 분류 모델을 학습하겠습니다. 특징 중요도를 사용할 수 있도록 모델을 만들 때 importance = "impurity"로 설정하세요. train과 test 세트가 제공되어 있어요.
tidyverse, tidymodels, vip 패키지는 미리 로드되어 있어요.
이 연습은 강의의 일부입니다
R에서의 차원 축소
연습 안내
- 특징 중요도를 추출할 수 있도록 트리 200개짜리 랜덤 포레스트 분류 모델을 정의하세요.
- 모든 예측 변수로 랜덤 포레스트 모델을 적합하세요.
- 예측값을 테스트 세트에 바인딩하세요.
- F1 지표를 계산하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Specify the random forest model
rf_spec <- ___(mode = "___", ___ = ___) %>%
set_engine("___", ___ = "___")
# Fit the random forest model with all predictors
rf_fit <- ___ %>%
___(___, data = ___)
# Create the test set prediction data frame
predict_df <- ___ %>%
bind_cols(predict = ___(___, ___))
# Calculate F1 performance
f_meas(predict_df, ___, .pred_class)