Praktiska aspekter: skalning
Som nämndes i videon kan klustring av verkliga data kräva skalning av särdragen om de har olika fördelningar. Hittills i det här kapitlet har du arbetat med syntetiska data som inte behövde skalas.
I den här övningen återgår du till att arbeta med "riktiga" data – datamängden pokemon som introducerades i det första kapitlet. Du ska undersöka fördelningen (medelvärde och standardavvikelse) för varje särdrag, skala data därefter och sedan skapa en hierarkisk klustringsmodell med metoden complete linkage.
Den här övningen är en del av kursen
Oövervakad inlärning i R
Övningsinstruktioner
Data finns lagrad i objektet pokemon i din arbetsmiljö.
- Undersök medelvärdet för varje variabel i
pokemonmed hjälp av funktionencolMeans(). - Undersök standardavvikelsen för varje variabel med hjälp av funktionerna
apply()ochsd(). Eftersom variablerna är kolumnerna i din matris, se till att ange 2 som argumentetMARGINiapply(). - Skala
pokemon-data med hjälp av funktionenscale()och lagra resultatet ipokemon.scaled. - Skapa en hierarkisk klustringsmodell av
pokemon.scaled-data med metoden complete linkage. Ange argumentetmethodmanuellt och lagra resultatet ihclust.pokemon.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# View column means
# View column standard deviations
# Scale the data
# Create hierarchical clustering model: hclust.pokemon