Začněte nyníZačněte zdarma

K-means: Průměrné šířky silhouette

Hierarchické shlukování dalo 3 shluky a metoda lokte navrhuje 2. V tomto cvičení použij průměrné šířky silhouette, abys zjistil/a, jaká by měla být „nejlepší" hodnota k.

Toto cvičení je součástí kurzu

Cluster Analysis v R

Zobrazit kurz

Pokyny k cvičení

  • Pomocí map_dbl() spusť pam() na datech oes pro hodnoty k od 2 do 10 a z každého modelu vyextrahuj hodnotu průměrné šířky silhouette: model$silinfo$avg.width. Výsledný vektor ulož jako sil_width.
  • Vytvoř nový datový rámec sil_df obsahující hodnoty k a vektor průměrných šířek silhouette.
  • Pomocí hodnot z sil_df vykresli spojnicový graf znázorňující vztah mezi k a průměrnou šířkou silhouette.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Use map_dbl to run many models with varying value of k
sil_width <- map_dbl(2:10,  function(k){
  model <- pam(___, k = ___)
  model$silinfo$avg.width
})

# Generate a data frame containing both k and sil_width
sil_df <- data.frame(
  k = ___,
  sil_width = ___
)

# Plot the relationship between k and sil_width
ggplot(___, aes(x = ___, y = ___)) +
  geom_line() +
  scale_x_continuous(breaks = 2:10)
Upravit a spustit kód