Tolka PCA-resultat
Nu ska du använda några visualiseringar för att bättre förstå din PCA-modell. En av dessa visualiseringar – biploten – introducerades i ett tidigare kapitel.
Du kommer att stöta på vanliga utmaningar med att använda biploter på verkliga data som innehåller ett icke-trivialt antal observationer och variabler. Därefter tittar du på några alternativa visualiseringar. Du uppmuntras att experimentera med ytterligare visualiseringar innan du går vidare till nästa övning.
Den här övningen är en del av kursen
Oövervakad inlärning i R
Övningsinstruktioner
Variablerna du skapade tidigare, wisc.data, diagnosis och wisc.pr, är fortfarande tillgängliga.
- Skapa en biplot av
wisc.pr-data. Vad lägger du märke till i det här diagrammet? Är det lätt eller svårt att förstå? Varför? - Kör koden för att skapa ett spridningsdiagram över varje observation utifrån huvudkomponent 1 och 2, med punkterna färgkodade efter diagnos.
- Gör samma sak för huvudkomponent 1 och 3. Vad observerar du i dessa diagram?
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a biplot of wisc.pr
# Scatter plot observations by components 1 and 2
plot(wisc.pr$___[, c(1, 2)], col = (diagnosis + 1),
xlab = "PC1", ylab = "PC2")
# Repeat for components 1 and 3
plot(___, col = (diagnosis + 1),
xlab = "PC1", ylab = "PC3")
# Do additional data exploration of your choosing below (optional)