Praktické otázky: škálování
Ve videu jsi viděl/a, že škálování dat před PCA ovlivňuje výsledky modelování. V tomto cvičení provedeš PCA se škálováním i bez něj a výsledky porovnáš pomocí biplotů.
Škálování je vhodné tehdy, když se rozptyly jednotlivých proměnných výrazně liší. To bývá typické v situacích, kdy mají proměnné různé jednotky měření – například stupně Fahrenheita (teplota) a míle (vzdálenost). Rozhodnutí, zda škálování použít, je důležitým krokem při provádění analýzy hlavních komponent.
Toto cvičení je součástí kurzu
Unsupervised Learning in R
Pokyny k cvičení
Ve tvém pracovním prostředí je k dispozici stejná datová sada Pokémonů jako pokemon, tentokrát ale s jednou novou proměnnou: Total.
- Na začátku editoru je kód pro výpočet průměru a směrodatné odchylky každé proměnné v modelu. Spusť ho a podívej se, jak se měřítka proměnných v původních datech liší.
- Vytvoř PCA model datasetu
pokemonse škálováním a výsledek ulož dopr.with.scaling. - Vytvoř PCA model datasetu
pokemonbez škálování a výsledek ulož dopr.without.scaling. - Pomocí
biplot()vykresli oba modely (každý zvlášť) a porovnej jejich výstupy.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Mean of each variable
colMeans(pokemon)
# Standard deviation of each variable
apply(pokemon, 2, sd)
# PCA model with scaling: pr.with.scaling
# PCA model without scaling: pr.without.scaling
# Create biplots of both for comparison