Visualisera många variabler
När antalet variabler ökar blir det allt svårare att visualisera dem alla samtidigt. Förutom x- och y-axlarna för två numeriska variabler kan du använda färg för en tredje numerisk variabel och fasettering för kategoriska variabler. Där går ungefär gränsen – fler variabler gör diagrammet svårtolkat. Det finns specialiserade diagramtyper som korrelationsvärmekartor och parallellkoordinatdiagram som hanterar fler variabler, men de ger betydligt mindre information om varje enskild variabel och lämpar sig inte så bra för att visualisera modellprediktioner.
Här pushar du spridningsdiagrammets gränser genom att visa huspriser, avstånd till närmaste MRT-station, antal närliggande snabbköp och husålder – allt i ett och samma diagram.
taiwan_real_estate är tillgängligt; ggplot2 är inläst.
Den här övningen är en del av kursen
Intermediär regression i R
Övningsinstruktioner
- Använd datamängden
taiwan_real_estateoch rita ett spridningsdiagram medn_conveniencemot kvadratroten avdist_to_mrt_m, färgkodad efterprice_twd_msq. - Använd den kontinuerliga viridis plasma-färgskalan.
- Fasettera diagrammet och bryt efter
house_age_years.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Using taiwan_real_estate, no. of conv. stores vs. sqrt of dist. to MRT, colored by plot house price
___ +
# Make it a scatter plot
___ +
# Use the continuous viridis plasma color scale
___ +
# Facet, wrapped by house age
___