Aan de slagBegin gratis

Modelprestaties vergelijken

Door te plotten krijg je een goed gevoel voor waar het model het goed doet en waar niet. Soms is het fijn om een statistiek te hebben die het model een score geeft. Zo kun je kwantificeren hoe goed een model is en veel modellen met elkaar vergelijken. Een veelgebruikte statistiek is de root mean square error (vaak afgekort tot "RMSE"), die simpelweg de residuen kwadrateert, daar het gemiddelde van neemt en vervolgens de wortel. Een kleine RMSE voor een bepaalde gegevensset duidt op betere voorspellingen. (Standaard kun je niet vergelijken tussen verschillende gegevenssets, alleen tussen modellen op dezelfde gegevensset. Soms kun je gegevenssets normaliseren om ze onderling te kunnen vergelijken.)

Hier ga je de modellen gradient boosted trees en random forest met elkaar vergelijken.

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

both_responses, met de voorspelde en werkelijke jaartallen van de track uit beide modellen, is vooraf gedefinieerd als een lokale tibble.

  • Maak een gegevensset met de som van kwadratische residuen.
    • Voeg een kolom residual toe, gelijk aan de voorspelde respons min de werkelijke respons.
    • Groepeer de data op model.
    • Bereken een samenvattende statistiek, rmse, gelijk aan de wortel uit het gemiddelde van de gekwadrateerde residuals.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# both_responses has been pre-defined
both_responses

# Create a residual sum of squares dataset
___
Code bewerken en uitvoeren