Jämföra modellernas prestanda
Visualisering ger dig en god känsla för var modellen presterar bra och var den brister. Ibland är det praktiskt att ha ett mått som ger en konkret poäng för modellen. På så sätt kan du kvantifiera hur bra en modell är och jämföra många modeller med varandra. Ett vanligt mått är rotmedelvärdesfelet (förkortat "RMSE"), som helt enkelt kvadrerar residualerna, beräknar medelvärdet och tar sedan kvadratroten. Ett lågt RMSE-värde för en given datamängd indikerar bättre prediktioner. (Som standard går det inte att jämföra RMSE-värden mellan olika datamängder – bara mellan olika modeller på samma datamängd. I vissa fall går det att normalisera datamängderna för att möjliggöra en sådan jämförelse.)
Här ska du jämföra modellerna med gradientförstärkta träd och slumpmässig skog.
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
both_responses, som innehåller de predikterade och faktiska årtalen för spåren från båda modellerna, har fördefinieras som en lokal tibble.
- Skapa en datamängd med residualernas kvadratsumma.
- Lägg till en kolumn
residual, lika med det predikterade värdet minus det faktiska värdet. - Gruppera datan efter
model. - Beräkna ett sammanfattande mått,
rmse, lika med kvadratroten ur medelvärdet av de kvadreraderesidual-värdena.
- Lägg till en kolumn
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# both_responses has been pre-defined
both_responses
# Create a residual sum of squares dataset
___