Clustering pe rezultatele PCA
În acest exercițiu final, vei combina mai mulți pași pe care i-ai parcurs anterior și vei experimenta o parte din creativitatea specifică învățării nesupervizate.
Amintește-ți din exercițiile anterioare că modelul PCA a necesitat mult mai puține caracteristici pentru a descrie 80% și, respectiv, 95% din variabilitatea datelor. Pe lângă normalizarea datelor și evitarea potențială a supraajustării, PCA elimină și corelațiile dintre variabile, îmbunătățind uneori performanța altor tehnici de modelare.
Hai să vedem dacă PCA îmbunătățește sau degradează performanța clustering-ului ierarhic.
Acest exercițiu face parte din cursul
Învățare nesupervizată în R
Instrucțiuni pentru exercițiu
wisc.pr, diagnosis, wisc.hclust.clusters și wisc.km sunt în continuare disponibile în spațiul tău de lucru.
- Folosind numărul minim de componente principale necesare pentru a descrie cel puțin 90% din variabilitatea datelor, creează un model de clustering ierarhic cu legătură completă. Atribuie rezultatele variabilei
wisc.pr.hclust. - Împarte acest model de clustering ierarhic în 4 clustere și atribuie rezultatele variabilei
wisc.pr.hclust.clusters. - Folosind
table(), compară rezultatele noului tău model de clustering ierarhic cu diagnosticele reale. Cât de bine separă noul model cu patru clustere cele două diagnostice? - Cât de bine separă diagnosticele modelele k-means și de clustering ierarhic create în exercițiile anterioare? Folosește din nou funcția
table()pentru a compara rezultatele fiecărui model cu vectorul care conține diagnosticele reale.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a hierarchical clustering model: wisc.pr.hclust
wisc.pr.hclust <- ___(dist(wisc.pr$___[, ___:___]), method = ___)
# Cut model into 4 clusters: wisc.pr.hclust.clusters
# Compare to actual diagnoses
# Compare to k-means and hierarchical