시작하기무료로 시작하기

알고리즘 평가 및 비교

GBTRegressor로 새 모델을 만들었으니, 이제 기준선인 RandomForestRegressor와 비교해 보겠습니다. 두 모델의 예측값을 실제 데이터와 비교하고 RMSE와 R^2를 계산할 거예요.

이 연습은 강의의 일부입니다

PySpark로 하는 Feature Engineering

강의 보기

연습 안내

  • 나중에 사용할 수 있도록 pyspark.ml.evaluation에서 RegressionEvaluator를 임포트하세요.
  • RegressionEvaluator를 초기화할 때 실제 데이터인 SALESCLOSEPRICElabelCol로, 예측 데이터인 Prediction_PricepredictionCol로 설정하세요.
  • 지표를 계산하려면, 예측값 predsevaluatorevaluate를 호출하고, 키를 evaluator.metricName, 값을 rmse로 하는 딕셔너리를 만들어 전달하세요. r2 지표도 같은 방식으로 계산하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

from ____ import ____

# Select columns to compute test error
evaluator = ____(____=____, 
                                ____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
  # Create evaluation metrics
  rmse = evaluator.____(____, {____: ____})
  r2 = evaluator.____(____, {____: ____})
  
  # Print Model Metrics
  print(key + ' RMSE: ' + str(rmse))
  print(key + ' R^2: ' + str(r2))
코드 편집 및 실행