Vliv škálování
Už víš, že pokud je jedna proměnná na výrazně větší škále než ostatní proměnné v datech, může nepřiměřeně ovlivnit výsledné vzdálenosti vypočítané mezi pozorováními. Pojďme si to ukázat na vzorku dat z datové sady trees.
Použijeme funkci scale(), která ve výchozím nastavení centruje a škáluje příznaky sloupců.
Naše proměnné jsou:
- Girth – průměr stromu v palcích
- Height – výška stromu v palcích
Toto cvičení je součástí kurzu
Cluster Analysis v R
Pokyny k cvičení
- Vypočítej matici vzdáleností pro datový rámec
three_treesa ulož ji jakodist_trees. - Vytvoř novou proměnnou
scaled_three_trees, ve které budou datathree_treescentrovaná a škálovaná. - Vypočítej a vypiš matici vzdáleností pro
scaled_three_treesa ulož ji jakodist_scaled_trees. - Zobraz obě matice –
dist_treesidist_scaled_trees– a sleduj, jak se změnilo, která pozorování mají mezi sebou nejmenší vzdálenost (nápověda: změnilo se to).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Calculate distance for three_trees
dist_trees <- ___
# Scale three trees & calculate the distance
scaled_three_trees <- ___
dist_scaled_trees <- ___
# Output the results of both Matrices
print('Without Scaling')
___
print('With Scaling')
___