Aan de slagBegin gratis

K-means: gemiddelde silhouette-breedtes

Hiërarchisch clusteren leverde 3 clusters op en de elbow-methode suggereert 2. In deze oefening gebruik je gemiddelde silhouette-breedtes om te verkennen wat de "beste" waarde van k zou moeten zijn.

Deze oefening maakt deel uit van de cursus

Clusteranalyse in R

Bekijk cursus

Oefeninstructies

  • Gebruik map_dbl() om pam() uit te voeren op de oes-data voor k-waarden van 2 tot en met 10 en extraheer uit elk model de waarde van de gemiddelde silhouette-breedte: model$silinfo$avg.width. Sla de resulterende vector op als sil_width.
  • Bouw een nieuw data frame sil_df met de waarden van k en de vector met gemiddelde silhouette-breedtes.
  • Gebruik de waarden in sil_df om een lijngrafiek te maken die de relatie laat zien tussen k en gemiddelde silhouette-breedte.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Use map_dbl to run many models with varying value of k
sil_width <- map_dbl(2:10,  function(k){
  model <- pam(___, k = ___)
  model$silinfo$avg.width
})

# Generate a data frame containing both k and sil_width
sil_df <- data.frame(
  k = ___,
  sil_width = ___
)

# Plot the relationship between k and sil_width
ggplot(___, aes(x = ___, y = ___)) +
  geom_line() +
  scale_x_continuous(breaks = 2:10)
Code bewerken en uitvoeren