Genereer voorspellingen en bereken de RMSE
Nu we een model hebben dat is getraind op onze gegevens en getuned via cross-validatie, kunnen we kijken hoe het presteert op de test-dataframe. Om dit te doen, berekenen we de RMSE.
Ter info: het genereren van testvoorspellingen duurt met deze gegevensset meer dan een paar minuten. Daarom zijn de testvoorspellingen al gegenereerd en hier beschikbaar als een dataframe genaamd test_predictions. Ter referentie: ze zijn gemaakt met deze code: test_predictions = best_model.transform(test).
Deze oefening maakt deel uit van de cursus
Aanbevelingssystemen bouwen met PySpark
Oefeninstructies
- De dataframe
test_predictionsbevat voorspellingen die ons cross-validated ALS-model heeft gegenereerd met de eerder gemaaktetest-set. Gebruik de methode.show()om ernaar te kijken en te zien of de voorspellingen in de buurt komen. - Gebruik de
evaluatordie je eerder hebt gebouwd om deRMSEte berekenen door de methode.evaluate()aan te roepen op de gegenereerdetest_predictions. Noem ditRMSE. - Print de
RMSE.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# View the predictions
test_predictions.____()
# Calculate and print the RMSE of test_predictions
RMSE = evaluator.____(____)
print(____)