Random Forest: 예측
이제 random forest 모델로 예측을 만들어 보세요. 문법은 gradient boosted trees 모델과 동일해요.
이 연습은 강의의 일부입니다
R에서 sparklyr로 시작하는 Spark
연습 안내
spark_conn으로 Spark 연결이 준비되어 있어요. Spark에 저장된 학습/테스트 데이터셋에 연결된 tibble은 각각 track_data_to_model_tbl, track_data_to_predict_tbl로 미리 정의되어 있어요. random forest 모델은 random_forest_model로 미리 정의되어 있어요.
- 테스트 데이터에 대한 모델 예측을 담는 변수
predicted를 정의하세요.ml_predict()를 모델과 테스트 데이터를 인수로 호출하세요. 이 함수는 테스트 데이터셋의 예측을 생성하고prediction이라는 새 컬럼으로 추가해요.
- 예측값과 실제 값을 비교할 수 있도록
responses변수를 정의하세요:- 반응 변수 컬럼
year를 선택하세요. - 결과를 collect 하세요.
mutate()를 사용해predicted에 담긴 예측값을 추가하세요.
- 반응 변수 컬럼
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___