K-means: Průměrné šířky silhouette
Hierarchické shlukování dalo 3 shluky a metoda lokte navrhuje 2. V tomto cvičení použij průměrné šířky silhouette, abys zjistil/a, jaká by měla být „nejlepší" hodnota k.
Toto cvičení je součástí kurzu
Cluster Analysis v R
Pokyny k cvičení
- Pomocí
map_dbl()spusťpam()na datechoespro hodnoty k od 2 do 10 a z každého modelu vyextrahuj hodnotu průměrné šířky silhouette:model$silinfo$avg.width. Výsledný vektor ulož jakosil_width. - Vytvoř nový datový rámec
sil_dfobsahující hodnoty k a vektor průměrných šířek silhouette. - Pomocí hodnot z
sil_dfvykresli spojnicový graf znázorňující vztah mezi k a průměrnou šířkou silhouette.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Use map_dbl to run many models with varying value of k
sil_width <- map_dbl(2:10, function(k){
model <- pam(___, k = ___)
model$silinfo$avg.width
})
# Generate a data frame containing both k and sil_width
sil_df <- data.frame(
k = ___,
sil_width = ___
)
# Plot the relationship between k and sil_width
ggplot(___, aes(x = ___, y = ___)) +
geom_line() +
scale_x_continuous(breaks = 2:10)