LoslegenKostenlos starten

Anzahl der Cluster auswählen

In dieser Übung vergleichst du die Ausgaben deines hierarchischen Clustering-Modells mit den tatsächlichen Diagnosen. Normalerweise steht bei unüberwachtem Lernen wie hier keine Zielvariable zur Verfügung. In diesem Datensatz haben wir sie jedoch, sodass wir die Leistung des Clustering-Modells prüfen können.

Beim überwachten Lernen – also wenn du eine Zielvariable vorhersagen willst und diese im ursprünglichen Datensatz vorhanden ist – kann die Verwendung von Clustering zur Erstellung neuer Features die Leistung des finalen Modells verbessern oder auch nicht. Diese Übung hilft dir einzuschätzen, ob hier hierarchisches Clustering ein vielversprechendes neues Feature liefert.

Diese Übung ist Teil des Kurses

<Kurs>Unüberwachtes Lernen in R</Kurs>
Kurs ansehen

Übungsanweisungen

wisc.data, diagnosis, wisc.pr, pve und wisc.hclust sind in deinem Workspace verfügbar.

  • Verwende cutree(), um den Baum so zu schneiden, dass er 4 Cluster hat. Weise die Ausgabe der Variable wisc.hclust.clusters zu.
  • Verwende die Funktion table(), um die Clusterzugehörigkeit mit den tatsächlichen Diagnosen zu vergleichen.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Cut tree so that it has 4 clusters: wisc.hclust.clusters


# Compare cluster membership to actual diagnoses
Code bearbeiten und ausführen