Jämföra kmeans() och hclust()
När du jämför k-means och hierarkisk klustring kommer du att märka att de två metoderna ger olika klustermedlemskap. Det beror på att algoritmerna bygger på olika antaganden om hur data genereras. I en mer avancerad kurs skulle vi kunna välja den ena modellen framför den andra utifrån hur väl antagandena stämmer – men för nu räcker det att konstatera att de skiljer sig åt.
I den här övningen jämför du resultaten från de två modellerna på datamängden pokemon för att se hur de skiljer sig åt.
Den här övningen är en del av kursen
Oövervakad inlärning i R
Övningsinstruktioner
Resultaten från k-means-klustring på pokemon-data (med 3 kluster) är lagrade som km.pokemon. Den hierarkiska klustringsmodell du skapade i föregående övning finns fortfarande tillgänglig som hclust.pokemon.
- Använd
cutree()påhclust.pokemonför att tilldela varje observation ett klustermedlemskap. Utgå från tre kluster och tilldela resultatet till en vektor med namnetcut.pokemon. - Använd
table()för att jämföra klustermedlemskapet mellan de två klustringsmetoderna. Kom ihåg att de olika komponenterna i ett k-means-modellobjekt kan nås med operatorn$.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Apply cutree() to hclust.pokemon: cut.pokemon
# Compare methods
table(___, ___)