Začněte nyníZačněte zdarma

Praktické otázky: škálování

Ve videu jsi viděl/a, že škálování dat před PCA ovlivňuje výsledky modelování. V tomto cvičení provedeš PCA se škálováním i bez něj a výsledky porovnáš pomocí biplotů.

Škálování je vhodné tehdy, když se rozptyly jednotlivých proměnných výrazně liší. To bývá typické v situacích, kdy mají proměnné různé jednotky měření – například stupně Fahrenheita (teplota) a míle (vzdálenost). Rozhodnutí, zda škálování použít, je důležitým krokem při provádění analýzy hlavních komponent.

Toto cvičení je součástí kurzu

Unsupervised Learning in R

Zobrazit kurz

Pokyny k cvičení

Ve tvém pracovním prostředí je k dispozici stejná datová sada Pokémonů jako pokemon, tentokrát ale s jednou novou proměnnou: Total.

  • Na začátku editoru je kód pro výpočet průměru a směrodatné odchylky každé proměnné v modelu. Spusť ho a podívej se, jak se měřítka proměnných v původních datech liší.
  • Vytvoř PCA model datasetu pokemon se škálováním a výsledek ulož do pr.with.scaling.
  • Vytvoř PCA model datasetu pokemon bez škálování a výsledek ulož do pr.without.scaling.
  • Pomocí biplot() vykresli oba modely (každý zvlášť) a porovnej jejich výstupy.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Mean of each variable
colMeans(pokemon)

# Standard deviation of each variable
apply(pokemon, 2, sd)

# PCA model with scaling: pr.with.scaling


# PCA model without scaling: pr.without.scaling


# Create biplots of both for comparison

Upravit a spustit kód