ÎncepețiÎncepe gratuit

Clustering pe rezultatele PCA

În acest exercițiu final, vei combina mai mulți pași pe care i-ai parcurs anterior și vei experimenta o parte din creativitatea specifică învățării nesupervizate.

Amintește-ți din exercițiile anterioare că modelul PCA a necesitat mult mai puține caracteristici pentru a descrie 80% și, respectiv, 95% din variabilitatea datelor. Pe lângă normalizarea datelor și evitarea potențială a supraajustării, PCA elimină și corelațiile dintre variabile, îmbunătățind uneori performanța altor tehnici de modelare.

Hai să vedem dacă PCA îmbunătățește sau degradează performanța clustering-ului ierarhic.

Acest exercițiu face parte din cursul

Învățare nesupervizată în R

Vezi cursul

Instrucțiuni pentru exercițiu

wisc.pr, diagnosis, wisc.hclust.clusters și wisc.km sunt în continuare disponibile în spațiul tău de lucru.

  • Folosind numărul minim de componente principale necesare pentru a descrie cel puțin 90% din variabilitatea datelor, creează un model de clustering ierarhic cu legătură completă. Atribuie rezultatele variabilei wisc.pr.hclust.
  • Împarte acest model de clustering ierarhic în 4 clustere și atribuie rezultatele variabilei wisc.pr.hclust.clusters.
  • Folosind table(), compară rezultatele noului tău model de clustering ierarhic cu diagnosticele reale. Cât de bine separă noul model cu patru clustere cele două diagnostice?
  • Cât de bine separă diagnosticele modelele k-means și de clustering ierarhic create în exercițiile anterioare? Folosește din nou funcția table() pentru a compara rezultatele fiecărui model cu vectorul care conține diagnosticele reale.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a hierarchical clustering model: wisc.pr.hclust
wisc.pr.hclust <- ___(dist(wisc.pr$___[, ___:___]), method = ___)

# Cut model into 4 clusters: wisc.pr.hclust.clusters


# Compare to actual diagnoses


# Compare to k-means and hierarchical
Editează și rulează codul