Selectarea numărului de clustere
În acest exercițiu, vei compara rezultatele modelului tău de clustering ierarhic cu diagnosticele reale. În mod normal, când aplici învățare nesupervizată ca aceasta, o variabilă țintă nu este disponibilă. În cazul acestui set de date, însă, ea există – astfel că poate fi folosită pentru a evalua performanța modelului de clustering.
Atunci când aplici învățare supervizată – adică atunci când încerci să prezici o variabilă țintă de interes și aceasta este disponibilă în datele originale – utilizarea clusteringului pentru a crea noi caracteristici poate sau nu poate îmbunătăți performanța modelului final. Acest exercițiu te va ajuta să determini dacă, în acest caz, clusteringul ierarhic oferă o caracteristică nouă promițătoare.
Acest exercițiu face parte din cursul
Învățare nesupervizată în R
Instrucțiuni pentru exercițiu
wisc.data, diagnosis, wisc.pr, pve și wisc.hclust sunt disponibile în spațiul tău de lucru.
- Folosește
cutree()pentru a tăia arborele astfel încât să obții 4 clustere. Atribuie rezultatul variabileiwisc.hclust.clusters. - Folosește funcția
table()pentru a compara apartenența la clustere cu diagnosticele reale.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Cut tree so that it has 4 clusters: wisc.hclust.clusters
# Compare cluster membership to actual diagnoses