Kom igångKom igång gratis

Praktiska aspekter: skalning

Som nämndes i videon kan klustring av verkliga data kräva skalning av särdragen om de har olika fördelningar. Hittills i det här kapitlet har du arbetat med syntetiska data som inte behövde skalas.

I den här övningen återgår du till att arbeta med "riktiga" data – datamängden pokemon som introducerades i det första kapitlet. Du ska undersöka fördelningen (medelvärde och standardavvikelse) för varje särdrag, skala data därefter och sedan skapa en hierarkisk klustringsmodell med metoden complete linkage.

Den här övningen är en del av kursen

Oövervakad inlärning i R

Visa kurs

Övningsinstruktioner

Data finns lagrad i objektet pokemon i din arbetsmiljö.

  • Undersök medelvärdet för varje variabel i pokemon med hjälp av funktionen colMeans().
  • Undersök standardavvikelsen för varje variabel med hjälp av funktionerna apply() och sd(). Eftersom variablerna är kolumnerna i din matris, se till att ange 2 som argumentet MARGIN i apply().
  • Skala pokemon-data med hjälp av funktionen scale() och lagra resultatet i pokemon.scaled.
  • Skapa en hierarkisk klustringsmodell av pokemon.scaled-data med metoden complete linkage. Ange argumentet method manuellt och lagra resultatet i hclust.pokemon.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# View column means


# View column standard deviations


# Scale the data


# Create hierarchical clustering model: hclust.pokemon
Redigera och kör kod