알고리즘 평가 및 비교
GBTRegressor로 새 모델을 만들었으니, 이제 기준선인 RandomForestRegressor와 비교해 보겠습니다. 두 모델의 예측값을 실제 데이터와 비교하고 RMSE와 R^2를 계산할 거예요.
이 연습은 강의의 일부입니다
PySpark로 하는 Feature Engineering
연습 안내
- 나중에 사용할 수 있도록
pyspark.ml.evaluation에서RegressionEvaluator를 임포트하세요. RegressionEvaluator를 초기화할 때 실제 데이터인SALESCLOSEPRICE를labelCol로, 예측 데이터인Prediction_Price를predictionCol로 설정하세요.- 지표를 계산하려면, 예측값
preds로evaluator의evaluate를 호출하고, 키를evaluator.metricName, 값을rmse로 하는 딕셔너리를 만들어 전달하세요.r2지표도 같은 방식으로 계산하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))