Praktické záležitosti: škálování
Z videa víš, že při clusteringu reálných dat může být potřeba škálování příznaků, pokud mají různá rozdělení. V této kapitole jsi zatím pracoval/a se syntetickými daty, která škálování nevyžadovala.
V tomto cvičení se vrátíš k "reálným" datům – k datasetu pokemon představenému v první kapitole. Prozkoumáš rozdělení (průměr a směrodatnou odchylku) každého příznaku, data podle toho škáluješ a následně vytvoříš hierarchický clusteringový model s využitím metody úplné vazby.
Toto cvičení je součástí kurzu
Unsupervised Learning in R
Pokyny k cvičení
Data jsou uložena v objektu pokemon v tvém pracovním prostoru.
- Zjisti průměr každé proměnné v datasetu
pokemonpomocí funkcecolMeans(). - Zjisti směrodatnou odchylku každé proměnné pomocí funkcí
apply()asd(). Protože proměnné jsou sloupce matice, nezapomeň zadat hodnotu 2 jako argumentMARGINfunkceapply(). - Škáluj data
pokemonpomocí funkcescale()a výsledek ulož do proměnnépokemon.scaled. - Vytvoř hierarchický clusteringový model dat
pokemon.scaleds využitím metody úplné vazby. Argumentmethodzadej ručně a výsledek ulož do proměnnéhclust.pokemon.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# View column means
# View column standard deviations
# Scale the data
# Create hierarchical clustering model: hclust.pokemon