Kom igångKom igång gratis

Slumpmässig skog: visualisering

Nu ska du visualisera prediktionerna. Med gradient boosting-modellen ritade du ett spridningsdiagram över predikterade värden mot faktiska värden, samt ett densitetsdiagram över residualerna. Nu ska du anpassa de diagrammen för att visa resultaten från båda modellerna samtidigt.

Den här övningen är en del av kursen

Introduktion till Spark med sparklyr i R

Visa kurs

Övningsinstruktioner

En lokal tibble both_responses, som innehåller predikterade och faktiska år för båda modellerna, har fördefinieras.

  • Uppdatera spridningsdiagrammet över predikterade vs. faktiska värden.
    • Använd datamängden both_responses.
    • Lägg till en färgestetik för att rita varje modell i en annan färg. Använd color = model.
    • Istället för att rita punkter, använd geom_smooth() för att rita en utjämnad kurva för varje modell.
  • Skapa en tibble med residualer, namngiven residuals.
    • Anropa mutate()both_responses.
    • Den nya kolumnen ska heta residual.
    • residual ska vara lika med det predikterade värdet minus det faktiska värdet.
  • Uppdatera densitetsdiagrammet för residualerna.
    • Lägg till en färgestetik för att rita varje modell i en annan färg.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# both_responses has been pre-defined
both_responses

# Draw a scatterplot of predicted vs. actual
ggplot(___, aes(actual, predicted, ___)) +
  # Add a smoothed line
  ___ +
  # Add a line at actual = predicted
  geom_abline(intercept = 0, slope = 1)

# Create a tibble of residuals
residuals <- ___

# Draw a density plot of residuals
ggplot(residuals, aes(residual, ___)) +
    # Add a density curve
    geom_density() +
    # Add a vertical line through zero
    geom_vline(xintercept = 0)
Redigera och kör kod