Anzahl der Cluster auswählen
In dieser Übung vergleichst du die Ausgaben deines hierarchischen Clustering-Modells mit den tatsächlichen Diagnosen. Normalerweise steht bei unüberwachtem Lernen wie hier keine Zielvariable zur Verfügung. In diesem Datensatz haben wir sie jedoch, sodass wir die Leistung des Clustering-Modells prüfen können.
Beim überwachten Lernen – also wenn du eine Zielvariable vorhersagen willst und diese im ursprünglichen Datensatz vorhanden ist – kann die Verwendung von Clustering zur Erstellung neuer Features die Leistung des finalen Modells verbessern oder auch nicht. Diese Übung hilft dir einzuschätzen, ob hier hierarchisches Clustering ein vielversprechendes neues Feature liefert.
Diese Übung ist Teil des Kurses
<Kurs>Unüberwachtes Lernen in R</Kurs>Übungsanweisungen
wisc.data, diagnosis, wisc.pr, pve und wisc.hclust sind in deinem Workspace verfügbar.
- Verwende
cutree(), um den Baum so zu schneiden, dass er 4 Cluster hat. Weise die Ausgabe der Variablewisc.hclust.clusterszu. - Verwende die Funktion
table(), um die Clusterzugehörigkeit mit den tatsächlichen Diagnosen zu vergleichen.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Cut tree so that it has 4 clusters: wisc.hclust.clusters
# Compare cluster membership to actual diagnoses