Vysvětlený rozptyl
V tomto cvičení vytvoříš scree ploty zobrazující podíl vysvětleného rozptylu v závislosti na počtu hlavních komponent. Data z PCA je nejprve potřeba připravit, protože R nenabízí žádnou vestavěnou funkci, která by tyto grafy vytvořila přímo z modelu PCA.
Až se na tyto grafy podíváš, zamysli se, zda se v množství vysvětleného rozptylu objevuje „loket" – místo zlomu, které by ti pomohlo zvolit přirozený počet hlavních komponent. Pokud žádný zřejmý zlom neexistuje – což je u reálných dat obvyklé – zkus přijít na jiný způsob, jak ze scree plotu určit, kolik hlavních komponent si ponechat.
Toto cvičení je součástí kurzu
Unsupervised Learning in R
Pokyny k cvičení
Proměnné, které jsi vytvořil/a dříve – wisc.data, diagnosis a wisc.pr – jsou stále k dispozici.
- Vypočítej rozptyl každé hlavní komponenty tak, že umocníš složku
sdevobjektuwisc.pr. Výsledek ulož do objektu s názvempr.var. - Vypočítej podíl rozptylu vysvětleného každou hlavní komponentou – vydělíš ji celkovým vysvětleným rozptylem všech hlavních komponent. Výsledek přiřaď do proměnné s názvem
pve. - Vytvoř graf vysvětleného rozptylu pro každou hlavní komponentu.
- Pomocí funkce
cumsum()vytvoř graf kumulativního podílu vysvětleného rozptylu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Set up 1 x 2 plotting grid
par(mfrow = c(1, 2))
# Calculate variability of each component
# Variance explained by each principal component: pve
# Plot variance explained for each principal component
plot(___, xlab = "Principal Component",
ylab = "Proportion of Variance Explained",
ylim = c(0, 1), type = "b")
# Plot cumulative proportion of variance explained
plot(___, xlab = "Principal Component",
ylab = "Cumulative Proportion of Variance Explained",
ylim = c(0, 1), type = "b")