시작하기무료로 시작하기

Random Forest: 예측

이제 random forest 모델로 예측을 만들어 보세요. 문법은 gradient boosted trees 모델과 동일해요.

이 연습은 강의의 일부입니다

R에서 sparklyr로 시작하는 Spark

강의 보기

연습 안내

spark_conn으로 Spark 연결이 준비되어 있어요. Spark에 저장된 학습/테스트 데이터셋에 연결된 tibble은 각각 track_data_to_model_tbl, track_data_to_predict_tbl로 미리 정의되어 있어요. random forest 모델은 random_forest_model로 미리 정의되어 있어요.

  • 테스트 데이터에 대한 모델 예측을 담는 변수 predicted를 정의하세요.
    • ml_predict()를 모델과 테스트 데이터를 인수로 호출하세요. 이 함수는 테스트 데이터셋의 예측을 생성하고 prediction이라는 새 컬럼으로 추가해요.
  • 예측값과 실제 값을 비교할 수 있도록 responses 변수를 정의하세요:
    • 반응 변수 컬럼 year를 선택하세요.
    • 결과를 collect 하세요.
    • mutate()를 사용해 predicted에 담긴 예측값을 추가하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model

# Predict the responses for the testing data
predicted <- ml_predict(
      ___,
      ___) %>% pull(prediction)

# Create a response vs. actual dataset
responses <- ___
코드 편집 및 실행