ÎncepețiÎncepe gratuit

Selectarea numărului de clustere

În acest exercițiu, vei compara rezultatele modelului tău de clustering ierarhic cu diagnosticele reale. În mod normal, când aplici învățare nesupervizată ca aceasta, o variabilă țintă nu este disponibilă. În cazul acestui set de date, însă, ea există – astfel că poate fi folosită pentru a evalua performanța modelului de clustering.

Atunci când aplici învățare supervizată – adică atunci când încerci să prezici o variabilă țintă de interes și aceasta este disponibilă în datele originale – utilizarea clusteringului pentru a crea noi caracteristici poate sau nu poate îmbunătăți performanța modelului final. Acest exercițiu te va ajuta să determini dacă, în acest caz, clusteringul ierarhic oferă o caracteristică nouă promițătoare.

Acest exercițiu face parte din cursul

Învățare nesupervizată în R

Vezi cursul

Instrucțiuni pentru exercițiu

wisc.data, diagnosis, wisc.pr, pve și wisc.hclust sunt disponibile în spațiul tău de lucru.

  • Folosește cutree() pentru a tăia arborele astfel încât să obții 4 clustere. Atribuie rezultatul variabilei wisc.hclust.clusters.
  • Folosește funcția table() pentru a compara apartenența la clustere cu diagnosticele reale.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Cut tree so that it has 4 clusters: wisc.hclust.clusters


# Compare cluster membership to actual diagnoses
Editează și rulează codul