Kom igångKom igång gratis

Välja antal kluster

I den här övningen jämför du resultaten från din hierarkiska klustringsmodell med de faktiska diagnoserna. Normalt sett saknas en målvariabel när man utför oövervakad inlärning som den här. I det här datasetet finns den dock tillgänglig, och den kan därför användas för att utvärdera klustringsmodellens prestanda.

När man utför övervakad inlärning – det vill säga när man försöker förutsäga en målvariabel som finns i ursprungsdata – kan klustring användas för att skapa nya särdrag, men det förbättrar inte alltid den slutliga modellens prestanda. Den här övningen hjälper dig att avgöra om hierarkisk klustring i det här fallet ger ett lovande nytt särdrag.

Den här övningen är en del av kursen

Oövervakad inlärning i R

Visa kurs

Övningsinstruktioner

wisc.data, diagnosis, wisc.pr, pve och wisc.hclust finns tillgängliga i din arbetsmiljö.

  • Använd cutree() för att dela upp trädet i 4 kluster. Tilldela resultatet till variabeln wisc.hclust.clusters.
  • Använd funktionen table() för att jämföra klustermedlemskapen med de faktiska diagnoserna.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Cut tree so that it has 4 clusters: wisc.hclust.clusters


# Compare cluster membership to actual diagnoses
Redigera och kör kod