ÎncepețiÎncepe gratuit

Clustering ierarhic al datelor din studiu de caz

Scopul acestui exercițiu este să aplici clustering ierarhic observațiilor. Reamintește-ți din Capitolul 2 că acest tip de clustering nu presupune în prealabil numărul de grupuri naturale existente în date.

Ca parte a pregătirii pentru clustering ierarhic, se calculează distanțele dintre toate perechile de observații. În plus, există diferite modalități de a lega clusterele între ele – single, complete și average fiind cele mai frecvente metode de legătură.

Acest exercițiu face parte din cursul

Învățare nesupervizată în R

Vezi cursul

Instrucțiuni pentru exercițiu

Variabilele create anterior, wisc.data, diagnosis, wisc.pr și pve, sunt disponibile în spațiul tău de lucru.

  • Scalează datele din wisc.data și atribuie rezultatul variabilei data.scaled.
  • Calculează distanțele (euclidiene) dintre toate perechile de observații din noul set de date scalat și atribuie rezultatul variabilei data.dist.
  • Creează un model de clustering ierarhic folosind legătura completă. Specifică manual argumentul method în hclust() și atribuie rezultatele variabilei wisc.hclust.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Scale the wisc.data data: data.scaled


# Calculate the (Euclidean) distances: data.dist


# Create a hierarchical clustering model: wisc.hclust
Editează și rulează codul