LoslegenKostenlos starten

Hierarchisches Clustering: Vorbereitung für die Exploration

Du hast nun ein mögliches Clustering für die oes-Daten erstellt. Bevor du diese Cluster mit ggplot2 untersuchen kannst, musst du die oes-Datenmatrix in einen aufgeräumten Data Frame umwandeln, in dem jeder Beruf seinem Cluster zugeordnet ist.

Diese Übung ist Teil des Kurses

<Kurs>Clusteranalyse in R</Kurs>
Kurs ansehen

Übungsanweisungen

  • Erstelle den Data Frame df_oes aus der oes-Datenmatrix und speichere dabei den Zeilennamen als Spalte (verwende rownames_to_column() aus dem Paket tibble).
  • Erzeuge den Vektor der Clusterzuordnungen cut_oes mit cutree() und einem h = 100,000.
  • Hänge die Clusterzuordnungen als Spalte cluster an den Data Frame df_oes an und speichere das Ergebnis in einem neuen Data Frame namens clust_oes.
  • Verwende die Funktion pivot_longer() aus dem Paket tidyr(), um die Daten in ein für die Analyse mit ggplot2 geeignetes Format zu bringen, und speichere den aufgeräumten Data Frame als gathered_oes.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

dist_oes <- dist(oes, method = 'euclidean')
hc_oes <- hclust(dist_oes, method = 'average')

library(tibble)
library(tidyr)

# Use rownames_to_column to move the rownames into a column of the data frame
df_oes <- rownames_to_column(as.data.frame(___), var = 'occupation')

# Create a cluster assignment vector at h = 100,000
cut_oes <- cutree(___, h = ___)

# Generate the segmented oes data frame
clust_oes <- mutate(___, cluster = ___)

# Create a tidy data frame by gathering the year and values into two columns
gathered_oes <- pivot_longer(data = ___, 
                       cols = -c(occupation, cluster),
                       names_to = "year",               
                       values_to = "mean_salary" )
Code bearbeiten und ausführen