Modelprestaties vergelijken
Door te plotten krijg je een goed gevoel voor waar het model het goed doet en waar niet. Soms is het fijn om een statistiek te hebben die het model een score geeft. Zo kun je kwantificeren hoe goed een model is en veel modellen met elkaar vergelijken. Een veelgebruikte statistiek is de root mean square error (vaak afgekort tot "RMSE"), die simpelweg de residuen kwadrateert, daar het gemiddelde van neemt en vervolgens de wortel. Een kleine RMSE voor een bepaalde gegevensset duidt op betere voorspellingen. (Standaard kun je niet vergelijken tussen verschillende gegevenssets, alleen tussen modellen op dezelfde gegevensset. Soms kun je gegevenssets normaliseren om ze onderling te kunnen vergelijken.)
Hier ga je de modellen gradient boosted trees en random forest met elkaar vergelijken.
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
both_responses, met de voorspelde en werkelijke jaartallen van de track uit beide modellen, is vooraf gedefinieerd als een lokale tibble.
- Maak een gegevensset met de som van kwadratische residuen.
- Voeg een kolom
residualtoe, gelijk aan de voorspelde respons min de werkelijke respons. - Groepeer de data op
model. - Bereken een samenvattende statistiek,
rmse, gelijk aan de wortel uit het gemiddelde van de gekwadrateerderesiduals.
- Voeg een kolom
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# both_responses has been pre-defined
both_responses
# Create a residual sum of squares dataset
___