Välja antal kluster
I den här övningen jämför du resultaten från din hierarkiska klustringsmodell med de faktiska diagnoserna. Normalt sett saknas en målvariabel när man utför oövervakad inlärning som den här. I det här datasetet finns den dock tillgänglig, och den kan därför användas för att utvärdera klustringsmodellens prestanda.
När man utför övervakad inlärning – det vill säga när man försöker förutsäga en målvariabel som finns i ursprungsdata – kan klustring användas för att skapa nya särdrag, men det förbättrar inte alltid den slutliga modellens prestanda. Den här övningen hjälper dig att avgöra om hierarkisk klustring i det här fallet ger ett lovande nytt särdrag.
Den här övningen är en del av kursen
Oövervakad inlärning i R
Övningsinstruktioner
wisc.data, diagnosis, wisc.pr, pve och wisc.hclust finns tillgängliga i din arbetsmiljö.
- Använd
cutree()för att dela upp trädet i 4 kluster. Tilldela resultatet till variabelnwisc.hclust.clusters. - Använd funktionen
table()för att jämföra klustermedlemskapen med de faktiska diagnoserna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Cut tree so that it has 4 clusters: wisc.hclust.clusters
# Compare cluster membership to actual diagnoses