Kom igångKom igång gratis

Klustring på PCA-resultat

I den här sista övningen sätter du ihop flera steg som du har använt tidigare och får på så sätt uppleva en del av den kreativitet som är typisk inom oövervakad inlärning.

Kom ihåg från tidigare övningar att PCA-modellen krävde betydligt färre särdrag för att beskriva 80 % och 95 % av datats variabilitet. Förutom att normalisera data och potentiellt undvika överanpassning avkorrelerar PCA även variablerna, vilket ibland förbättrar prestandan hos andra modelleringstekniker.

Låt oss se om PCA förbättrar eller försämrar prestandan hos hierarkisk klustring.

Den här övningen är en del av kursen

Oövervakad inlärning i R

Visa kurs

Övningsinstruktioner

wisc.pr, diagnosis, wisc.hclust.clusters och wisc.km finns fortfarande tillgängliga i din arbetsyta.

  • Skapa en hierarkisk klustringsmodell med fullständig länkning med hjälp av det minsta antalet principalkomponenter som krävs för att beskriva minst 90 % av variabiliteten i datan. Tilldela resultaten till wisc.pr.hclust.
  • Dela upp den hierarkiska klustringsmodellen i 4 kluster och tilldela resultaten till wisc.pr.hclust.clusters.
  • Använd table() för att jämföra resultaten från din nya hierarkiska klustringsmodell med de faktiska diagnoserna. Hur väl separerar den nya modellen med fyra kluster de två diagnoserna?
  • Hur väl separerar de k-means- och hierarkiska klustringsmodeller som du skapade i tidigare övningar diagnoserna? Använd återigen funktionen table() för att jämföra utdata från varje modell med vektorn som innehåller de faktiska diagnoserna.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create a hierarchical clustering model: wisc.pr.hclust
wisc.pr.hclust <- ___(dist(wisc.pr$___[, ___:___]), method = ___)

# Cut model into 4 clusters: wisc.pr.hclust.clusters


# Compare to actual diagnoses


# Compare to k-means and hierarchical
Redigera och kör kod