ÎncepețiÎncepe gratuit

Clustering k-means și compararea rezultatelor

Știi deja că există două tipuri principale de clustering: ierarhic și k-means.

În acest exercițiu, vei crea un model de clustering k-means pe datele despre cancerul mamar Wisconsin și vei compara rezultatele cu diagnosticele reale și cu rezultatele modelului tău de clustering ierarhic. Acordă-ți timp să analizezi cât de bine separă fiecare model de clustering cele două diagnostice și cum se compară modelele între ele.

Acest exercițiu face parte din cursul

Învățare nesupervizată în R

Vezi cursul

Instrucțiuni pentru exercițiu

wisc.data, diagnosis și wisc.hclust.clusters sunt încă disponibile.

  • Creează un model k-means pe wisc.data, atribuind rezultatul variabilei wisc.km. Asigură-te că definești 2 clustere, corespunzătoare numărului real de diagnostice. Nu uita să scalezi datele și să repeți algoritmul de 20 de ori pentru a obține un model performant.
  • Folosește funcția table() pentru a compara apartenența la clustere a modelului k-means cu diagnosticele reale din vectorul diagnosis. Cât de bine separă k-means cele două diagnostice?
  • Folosește funcția table() pentru a compara apartenența la clustere a modelului k-means cu modelul de clustering ierarhic. Reține că apartenența la clustere a modelului ierarhic este stocată în wisc.hclust.clusters.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a k-means model on wisc.data: wisc.km


# Compare k-means to actual diagnoses


# Compare k-means to hierarchical clustering
Editează și rulează codul