Začněte nyníZačněte zdarma

Praktické záležitosti: škálování

Z videa víš, že při clusteringu reálných dat může být potřeba škálování příznaků, pokud mají různá rozdělení. V této kapitole jsi zatím pracoval/a se syntetickými daty, která škálování nevyžadovala.

V tomto cvičení se vrátíš k "reálným" datům – k datasetu pokemon představenému v první kapitole. Prozkoumáš rozdělení (průměr a směrodatnou odchylku) každého příznaku, data podle toho škáluješ a následně vytvoříš hierarchický clusteringový model s využitím metody úplné vazby.

Toto cvičení je součástí kurzu

Unsupervised Learning in R

Zobrazit kurz

Pokyny k cvičení

Data jsou uložena v objektu pokemon v tvém pracovním prostoru.

  • Zjisti průměr každé proměnné v datasetu pokemon pomocí funkce colMeans().
  • Zjisti směrodatnou odchylku každé proměnné pomocí funkcí apply() a sd(). Protože proměnné jsou sloupce matice, nezapomeň zadat hodnotu 2 jako argument MARGIN funkce apply().
  • Škáluj data pokemon pomocí funkce scale() a výsledek ulož do proměnné pokemon.scaled.
  • Vytvoř hierarchický clusteringový model dat pokemon.scaled s využitím metody úplné vazby. Argument method zadej ručně a výsledek ulož do proměnné hclust.pokemon.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# View column means


# View column standard deviations


# Scale the data


# Create hierarchical clustering model: hclust.pokemon
Upravit a spustit kód