ÎncepețiÎncepe gratuit

Aspecte practice: scalarea

Reține din videoclip că, atunci când lucrezi cu date reale, clustering-ul poate necesita scalarea caracteristicilor dacă acestea au distribuții diferite. Până acum, în acest capitol, ai lucrat cu date sintetice care nu aveau nevoie de scalare.

În acest exercițiu, vei reveni la date „reale" – setul de date pokemon introdus în primul capitol. Vei observa distribuția (media și abaterea standard) a fiecărei caracteristici, vei scala datele corespunzător, iar apoi vei construi un model de clustering ierarhic folosind metoda legăturii complete.

Acest exercițiu face parte din cursul

Învățare nesupervizată în R

Vezi cursul

Instrucțiuni pentru exercițiu

Datele sunt stocate în obiectul pokemon din spațiul tău de lucru.

  • Observă media fiecărei variabile din pokemon folosind funcția colMeans().
  • Observă abaterea standard a fiecărei variabile folosind funcțiile apply() și sd(). Deoarece variabilele sunt coloanele matricei tale, asigură-te că specifici 2 ca argument MARGIN pentru apply().
  • Scalează datele pokemon folosind funcția scale() și stochează rezultatul în pokemon.scaled.
  • Creează un model de clustering ierarhic pentru datele pokemon.scaled folosind metoda legăturii complete. Specifică manual argumentul method și stochează rezultatul în hclust.pokemon.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# View column means


# View column standard deviations


# Scale the data


# Create hierarchical clustering model: hclust.pokemon
Editează și rulează codul