Začněte nyníZačněte zdarma

Vliv škálování

Už víš, že pokud je jedna proměnná na výrazně větší škále než ostatní proměnné v datech, může nepřiměřeně ovlivnit výsledné vzdálenosti vypočítané mezi pozorováními. Pojďme si to ukázat na vzorku dat z datové sady trees.

Použijeme funkci scale(), která ve výchozím nastavení centruje a škáluje příznaky sloupců.

Naše proměnné jsou:

  • Girth – průměr stromu v palcích
  • Height – výška stromu v palcích

Toto cvičení je součástí kurzu

Cluster Analysis v R

Zobrazit kurz

Pokyny k cvičení

  • Vypočítej matici vzdáleností pro datový rámec three_trees a ulož ji jako dist_trees.
  • Vytvoř novou proměnnou scaled_three_trees, ve které budou data three_trees centrovaná a škálovaná.
  • Vypočítej a vypiš matici vzdáleností pro scaled_three_trees a ulož ji jako dist_scaled_trees.
  • Zobraz obě matice – dist_trees i dist_scaled_trees – a sleduj, jak se změnilo, která pozorování mají mezi sebou nejmenší vzdálenost (nápověda: změnilo se to).

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Calculate distance for three_trees 
dist_trees <- ___

# Scale three trees & calculate the distance  
scaled_three_trees <- ___
dist_scaled_trees <- ___

# Output the results of both Matrices
print('Without Scaling')
___

print('With Scaling')
___
Upravit a spustit kód