Silhouettenanalyse
Mit der Silhouettenanalyse misst du, wie ähnlich jede Beobachtung dem ihr zugewiesenen Cluster im Vergleich zu anderen Clustern ist. Diese Kennzahl (Silhouettenbreite) liegt für jede Beobachtung in deinen Daten zwischen -1 und 1 und lässt sich wie folgt interpretieren:
- Werte nahe 1 deuten darauf hin, dass die Beobachtung gut zum zugewiesenen Cluster passt
- Werte nahe 0 deuten darauf hin, dass die Beobachtung grenzwertig zwischen zwei Clustern liegt
- Werte nahe -1 deuten darauf hin, dass die Beobachtung möglicherweise dem falschen Cluster zugeordnet wurde
In dieser Übung nutzt du die Funktionen pam() und silhouette() aus der Bibliothek cluster, um eine Silhouettenanalyse durchzuführen und die Ergebnisse von Modellen mit k = 2 und k = 3 zu vergleichen. Du arbeitest weiter mit dem Datensatz lineup.
Achte genau auf das Silhouetten-Diagramm: Gehört bei k = 3 jede Beobachtung eindeutig zu ihrem zugewiesenen Cluster?
Diese Übung ist Teil des Kurses
<Kurs>Clusteranalyse in R</Kurs>Übungsanweisungen
- Erzeuge mit
pam()undk = 2auf denlineup-Daten ein k-Means-Modellpam_k2. - Zeichne die Silhouettenanalyse mit
plot(silhouette(model)). - Wiederhole die ersten beiden Schritte für
k = 3und speichere das Modell alspam_k3. - Schau dir die Unterschiede zwischen den Diagrammen an, bevor du weitermachst (insbesondere Beobachtung 3) für
pam_k3.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
library(cluster)
# Generate a k-means model using the pam() function with a k = 2
pam_k2 <- pam(___, k = ___)
# Plot the silhouette visual for the pam_k2 model
plot(silhouette(___))
# Generate a k-means model using the pam() function with a k = 3
pam_k3 <- ___
# Plot the silhouette visual for the pam_k3 model