Clustering ierarhic al datelor din studiu de caz
Scopul acestui exercițiu este să aplici clustering ierarhic observațiilor. Reamintește-ți din Capitolul 2 că acest tip de clustering nu presupune în prealabil numărul de grupuri naturale existente în date.
Ca parte a pregătirii pentru clustering ierarhic, se calculează distanțele dintre toate perechile de observații. În plus, există diferite modalități de a lega clusterele între ele – single, complete și average fiind cele mai frecvente metode de legătură.
Acest exercițiu face parte din cursul
Învățare nesupervizată în R
Instrucțiuni pentru exercițiu
Variabilele create anterior, wisc.data, diagnosis, wisc.pr și pve, sunt disponibile în spațiul tău de lucru.
- Scalează datele din
wisc.datași atribuie rezultatul variabileidata.scaled. - Calculează distanțele (euclidiene) dintre toate perechile de observații din noul set de date scalat și atribuie rezultatul variabilei
data.dist. - Creează un model de clustering ierarhic folosind legătura completă. Specifică manual argumentul
methodînhclust()și atribuie rezultatele variabileiwisc.hclust.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Scale the wisc.data data: data.scaled
# Calculate the (Euclidean) distances: data.dist
# Create a hierarchical clustering model: wisc.hclust