K-means: gemiddelde silhouette-breedtes
Hiërarchisch clusteren leverde 3 clusters op en de elbow-methode suggereert 2. In deze oefening gebruik je gemiddelde silhouette-breedtes om te verkennen wat de "beste" waarde van k zou moeten zijn.
Deze oefening maakt deel uit van de cursus
Clusteranalyse in R
Oefeninstructies
- Gebruik
map_dbl()ompam()uit te voeren op deoes-data voor k-waarden van 2 tot en met 10 en extraheer uit elk model de waarde van de gemiddelde silhouette-breedte:model$silinfo$avg.width. Sla de resulterende vector op alssil_width. - Bouw een nieuw data frame
sil_dfmet de waarden van k en de vector met gemiddelde silhouette-breedtes. - Gebruik de waarden in
sil_dfom een lijngrafiek te maken die de relatie laat zien tussen k en gemiddelde silhouette-breedte.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Use map_dbl to run many models with varying value of k
sil_width <- map_dbl(2:10, function(k){
model <- pam(___, k = ___)
model$silinfo$avg.width
})
# Generate a data frame containing both k and sil_width
sil_df <- data.frame(
k = ___,
sil_width = ___
)
# Plot the relationship between k and sil_width
ggplot(___, aes(x = ___, y = ___)) +
geom_line() +
scale_x_continuous(breaks = 2:10)