Random Forest: visualisatie
Nu moet je de voorspellingen plotten. Bij het gradient boosted trees-model maakte je een spreidingsdiagram van voorspelde ten opzichte van werkelijke waarden, en een dichtheidsplot van de residuen. Je gaat deze plots nu aanpassen zodat ze de resultaten van beide modellen tegelijk laten zien.
Deze oefening maakt deel uit van de cursus
Introductie tot Spark met sparklyr in R
Oefeninstructies
Een lokale tibble both_responses, met de voorspelde en werkelijke jaren voor beide modellen, is al vooraf gedefinieerd.
- Werk het spreidingsdiagram van voorspeld vs. werkelijk bij.
- Gebruik de gegevensset
both_responses. - Voeg een kleur-esthetiek toe om elk model in een andere kleur te tekenen. Gebruik
color = model. - Gebruik in plaats van punten
geom_smooth()om voor elk model een vloeiende curve te tekenen.
- Gebruik de gegevensset
- Maak een tibble met residuen, genaamd
residuals.- Roep
mutate()aan opboth_responses. - De nieuwe kolom moet
residualheten. residualmoet gelijk zijn aan de voorspelde waarde minus de werkelijke waarde.
- Roep
- Werk de dichtheidsplot van de residuen bij.
- Voeg een kleur-esthetiek toe om elk model in een andere kleur te tekenen.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# both_responses has been pre-defined
both_responses
# Draw a scatterplot of predicted vs. actual
ggplot(___, aes(actual, predicted, ___)) +
# Add a smoothed line
___ +
# Add a line at actual = predicted
geom_abline(intercept = 0, slope = 1)
# Create a tibble of residuals
residuals <- ___
# Draw a density plot of residuals
ggplot(residuals, aes(residual, ___)) +
# Add a density curve
geom_density() +
# Add a vertical line through zero
geom_vline(xintercept = 0)