Aan de slagBegin gratis

Random Forest: visualisatie

Nu moet je de voorspellingen plotten. Bij het gradient boosted trees-model maakte je een spreidingsdiagram van voorspelde ten opzichte van werkelijke waarden, en een dichtheidsplot van de residuen. Je gaat deze plots nu aanpassen zodat ze de resultaten van beide modellen tegelijk laten zien.

Deze oefening maakt deel uit van de cursus

Introductie tot Spark met sparklyr in R

Bekijk cursus

Oefeninstructies

Een lokale tibble both_responses, met de voorspelde en werkelijke jaren voor beide modellen, is al vooraf gedefinieerd.

  • Werk het spreidingsdiagram van voorspeld vs. werkelijk bij.
    • Gebruik de gegevensset both_responses.
    • Voeg een kleur-esthetiek toe om elk model in een andere kleur te tekenen. Gebruik color = model.
    • Gebruik in plaats van punten geom_smooth() om voor elk model een vloeiende curve te tekenen.
  • Maak een tibble met residuen, genaamd residuals.
    • Roep mutate() aan op both_responses.
    • De nieuwe kolom moet residual heten.
    • residual moet gelijk zijn aan de voorspelde waarde minus de werkelijke waarde.
  • Werk de dichtheidsplot van de residuen bij.
    • Voeg een kleur-esthetiek toe om elk model in een andere kleur te tekenen.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# both_responses has been pre-defined
both_responses

# Draw a scatterplot of predicted vs. actual
ggplot(___, aes(actual, predicted, ___)) +
  # Add a smoothed line
  ___ +
  # Add a line at actual = predicted
  geom_abline(intercept = 0, slope = 1)

# Create a tibble of residuals
residuals <- ___

# Draw a density plot of residuals
ggplot(residuals, aes(residual, ___)) +
    # Add a density curve
    geom_density() +
    # Add a vertical line through zero
    geom_vline(xintercept = 0)
Code bewerken en uitvoeren