LoslegenKostenlos starten

Silhouettenanalyse

Mit der Silhouettenanalyse misst du, wie ähnlich jede Beobachtung dem ihr zugewiesenen Cluster im Vergleich zu anderen Clustern ist. Diese Kennzahl (Silhouettenbreite) liegt für jede Beobachtung in deinen Daten zwischen -1 und 1 und lässt sich wie folgt interpretieren:

  • Werte nahe 1 deuten darauf hin, dass die Beobachtung gut zum zugewiesenen Cluster passt
  • Werte nahe 0 deuten darauf hin, dass die Beobachtung grenzwertig zwischen zwei Clustern liegt
  • Werte nahe -1 deuten darauf hin, dass die Beobachtung möglicherweise dem falschen Cluster zugeordnet wurde

In dieser Übung nutzt du die Funktionen pam() und silhouette() aus der Bibliothek cluster, um eine Silhouettenanalyse durchzuführen und die Ergebnisse von Modellen mit k = 2 und k = 3 zu vergleichen. Du arbeitest weiter mit dem Datensatz lineup.

Achte genau auf das Silhouetten-Diagramm: Gehört bei k = 3 jede Beobachtung eindeutig zu ihrem zugewiesenen Cluster?

Diese Übung ist Teil des Kurses

<Kurs>Clusteranalyse in R</Kurs>
Kurs ansehen

Übungsanweisungen

  • Erzeuge mit pam() und k = 2 auf den lineup-Daten ein k-Means-Modell pam_k2.
  • Zeichne die Silhouettenanalyse mit plot(silhouette(model)).
  • Wiederhole die ersten beiden Schritte für k = 3 und speichere das Modell als pam_k3.
  • Schau dir die Unterschiede zwischen den Diagrammen an, bevor du weitermachst (insbesondere Beobachtung 3) für pam_k3.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

library(cluster)

# Generate a k-means model using the pam() function with a k = 2
pam_k2 <- pam(___, k = ___)

# Plot the silhouette visual for the pam_k2 model
plot(silhouette(___))

# Generate a k-means model using the pam() function with a k = 3
pam_k3 <- ___

# Plot the silhouette visual for the pam_k3 model

Code bearbeiten und ausführen