Clustering k-means și compararea rezultatelor
Știi deja că există două tipuri principale de clustering: ierarhic și k-means.
În acest exercițiu, vei crea un model de clustering k-means pe datele despre cancerul mamar Wisconsin și vei compara rezultatele cu diagnosticele reale și cu rezultatele modelului tău de clustering ierarhic. Acordă-ți timp să analizezi cât de bine separă fiecare model de clustering cele două diagnostice și cum se compară modelele între ele.
Acest exercițiu face parte din cursul
Învățare nesupervizată în R
Instrucțiuni pentru exercițiu
wisc.data, diagnosis și wisc.hclust.clusters sunt încă disponibile.
- Creează un model k-means pe
wisc.data, atribuind rezultatul variabileiwisc.km. Asigură-te că definești 2 clustere, corespunzătoare numărului real de diagnostice. Nu uita să scalezi datele și să repeți algoritmul de 20 de ori pentru a obține un model performant. - Folosește funcția
table()pentru a compara apartenența la clustere a modelului k-means cu diagnosticele reale din vectoruldiagnosis. Cât de bine separă k-means cele două diagnostice? - Folosește funcția
table()pentru a compara apartenența la clustere a modelului k-means cu modelul de clustering ierarhic. Reține că apartenența la clustere a modelului ierarhic este stocată înwisc.hclust.clusters.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a k-means model on wisc.data: wisc.km
# Compare k-means to actual diagnoses
# Compare k-means to hierarchical clustering