k-means-klustring och jämförelse av resultat
Som du nu vet finns det två huvudtyper av klustring: hierarkisk och k-means.
I den här övningen skapar du en k-means-klustringsmodell på Wisconsin-data över bröstcancer och jämför resultaten med de faktiska diagnoserna och din hierarkiska klustringsmodell. Ta dig tid att undersöka hur väl varje klustringsmodell separerar de två diagnoserna och hur modellerna förhåller sig till varandra.
Den här övningen är en del av kursen
Oövervakad inlärning i R
Övningsinstruktioner
wisc.data, diagnosis och wisc.hclust.clusters är fortfarande tillgängliga.
- Skapa en k-means-modell på
wisc.dataoch tilldela resultatet tillwisc.km. Se till att skapa 2 kluster, vilket motsvarar det faktiska antalet diagnoser. Kom också ihåg att skala data och upprepa algoritmen 20 gånger för att hitta en väl presterande modell. - Använd funktionen
table()för att jämföra klustermedlemskapet i k-means-modellen med de faktiska diagnoserna i vektorndiagnosis. Hur väl separerar k-means de två diagnoserna? - Använd funktionen
table()för att jämföra klustermedlemskapet i k-means-modellen med den hierarkiska klustringsmodellen. Klustermedlemskapet för den hierarkiska klustringsmodellen finns iwisc.hclust.clusters.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a k-means model on wisc.data: wisc.km
# Compare k-means to actual diagnoses
# Compare k-means to hierarchical clustering