Aspecte practice: scalarea
Reține din videoclip că, atunci când lucrezi cu date reale, clustering-ul poate necesita scalarea caracteristicilor dacă acestea au distribuții diferite. Până acum, în acest capitol, ai lucrat cu date sintetice care nu aveau nevoie de scalare.
În acest exercițiu, vei reveni la date „reale" – setul de date pokemon introdus în primul capitol. Vei observa distribuția (media și abaterea standard) a fiecărei caracteristici, vei scala datele corespunzător, iar apoi vei construi un model de clustering ierarhic folosind metoda legăturii complete.
Acest exercițiu face parte din cursul
Învățare nesupervizată în R
Instrucțiuni pentru exercițiu
Datele sunt stocate în obiectul pokemon din spațiul tău de lucru.
- Observă media fiecărei variabile din
pokemonfolosind funcțiacolMeans(). - Observă abaterea standard a fiecărei variabile folosind funcțiile
apply()șisd(). Deoarece variabilele sunt coloanele matricei tale, asigură-te că specifici 2 ca argumentMARGINpentruapply(). - Scalează datele
pokemonfolosind funcțiascale()și stochează rezultatul înpokemon.scaled. - Creează un model de clustering ierarhic pentru datele
pokemon.scaledfolosind metoda legăturii complete. Specifică manual argumentulmethodși stochează rezultatul înhclust.pokemon.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# View column means
# View column standard deviations
# Scale the data
# Create hierarchical clustering model: hclust.pokemon