Slumpmässig skog: visualisering
Nu ska du visualisera prediktionerna. Med gradient boosting-modellen ritade du ett spridningsdiagram över predikterade värden mot faktiska värden, samt ett densitetsdiagram över residualerna. Nu ska du anpassa de diagrammen för att visa resultaten från båda modellerna samtidigt.
Den här övningen är en del av kursen
Introduktion till Spark med sparklyr i R
Övningsinstruktioner
En lokal tibble both_responses, som innehåller predikterade och faktiska år för båda modellerna, har fördefinieras.
- Uppdatera spridningsdiagrammet över predikterade vs. faktiska värden.
- Använd datamängden
both_responses. - Lägg till en färgestetik för att rita varje modell i en annan färg. Använd
color = model. - Istället för att rita punkter, använd
geom_smooth()för att rita en utjämnad kurva för varje modell.
- Använd datamängden
- Skapa en tibble med residualer, namngiven
residuals.- Anropa
mutate()påboth_responses. - Den nya kolumnen ska heta
residual. residualska vara lika med det predikterade värdet minus det faktiska värdet.
- Anropa
- Uppdatera densitetsdiagrammet för residualerna.
- Lägg till en färgestetik för att rita varje modell i en annan färg.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# both_responses has been pre-defined
both_responses
# Draw a scatterplot of predicted vs. actual
ggplot(___, aes(actual, predicted, ___)) +
# Add a smoothed line
___ +
# Add a line at actual = predicted
geom_abline(intercept = 0, slope = 1)
# Create a tibble of residuals
residuals <- ___
# Draw a density plot of residuals
ggplot(residuals, aes(residual, ___)) +
# Add a density curve
geom_density() +
# Add a vertical line through zero
geom_vline(xintercept = 0)