Hierarchisches Clustering der Falldaten
Ziel dieser Übung ist es, hierarchisches Clustering der Beobachtungen durchzuführen. Erinnerst du dich an Kapitel 2: Bei dieser Art von Clustering wird die Anzahl der natürlichen Gruppen im Datensatz nicht im Voraus festgelegt.
Als Vorbereitung auf das hierarchische Clustering werden die Distanzen zwischen allen Paaren von Beobachtungen berechnet. Außerdem gibt es verschiedene Möglichkeiten, Cluster miteinander zu verknüpfen; zu den gängigsten Linkage-Methoden gehören „single“, „complete“ und „average“.
Diese Übung ist Teil des Kurses
<Kurs>Unüberwachtes Lernen in R</Kurs>Übungsanweisungen
Die zuvor erstellten Variablen wisc.data, diagnosis, wisc.pr und pve stehen in deinem Workspace zur Verfügung.
- Skaliere die Daten in
wisc.dataund weise das Ergebnisdata.scaledzu. - Berechne die (euklidischen) Distanzen zwischen allen Beobachtungspaaren im neu skalierten Datensatz und weise das Ergebnis
data.distzu. - Erstelle ein hierarchisches Clustering-Modell mit Complete-Linkage. Gib das Argument
methodinhclust()manuell an und weise das Ergebniswisc.hclustzu.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Scale the wisc.data data: data.scaled
# Calculate the (Euclidean) distances: data.dist
# Create a hierarchical clustering model: wisc.hclust