Začněte nyníZačněte zdarma

Vysvětlený rozptyl

V tomto cvičení vytvoříš scree ploty zobrazující podíl vysvětleného rozptylu v závislosti na počtu hlavních komponent. Data z PCA je nejprve potřeba připravit, protože R nenabízí žádnou vestavěnou funkci, která by tyto grafy vytvořila přímo z modelu PCA.

Až se na tyto grafy podíváš, zamysli se, zda se v množství vysvětleného rozptylu objevuje „loket" – místo zlomu, které by ti pomohlo zvolit přirozený počet hlavních komponent. Pokud žádný zřejmý zlom neexistuje – což je u reálných dat obvyklé – zkus přijít na jiný způsob, jak ze scree plotu určit, kolik hlavních komponent si ponechat.

Toto cvičení je součástí kurzu

Unsupervised Learning in R

Zobrazit kurz

Pokyny k cvičení

Proměnné, které jsi vytvořil/a dříve – wisc.data, diagnosis a wisc.pr – jsou stále k dispozici.

  • Vypočítej rozptyl každé hlavní komponenty tak, že umocníš složku sdev objektu wisc.pr. Výsledek ulož do objektu s názvem pr.var.
  • Vypočítej podíl rozptylu vysvětleného každou hlavní komponentou – vydělíš ji celkovým vysvětleným rozptylem všech hlavních komponent. Výsledek přiřaď do proměnné s názvem pve.
  • Vytvoř graf vysvětleného rozptylu pro každou hlavní komponentu.
  • Pomocí funkce cumsum() vytvoř graf kumulativního podílu vysvětleného rozptylu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Set up 1 x 2 plotting grid
par(mfrow = c(1, 2))

# Calculate variability of each component


# Variance explained by each principal component: pve


# Plot variance explained for each principal component
plot(___, xlab = "Principal Component", 
     ylab = "Proportion of Variance Explained", 
     ylim = c(0, 1), type = "b")

# Plot cumulative proportion of variance explained
plot(___, xlab = "Principal Component", 
     ylab = "Cumulative Proportion of Variance Explained", 
     ylim = c(0, 1), type = "b")
Upravit a spustit kód