Aan de slagBegin gratis

Hierarchical clustering: Preparing for exploration

Je hebt nu een mogelijke clustering voor de oes-gegevens gemaakt. Voordat je deze clusters met ggplot2 kunt verkennen, moet je de oes-gegevensmatrix omzetten naar een nette data frame waarin elk beroep aan zijn cluster is toegewezen.

Deze oefening maakt deel uit van de cursus

Clusteranalyse in R

Bekijk cursus

Oefeninstructies

  • Maak de data frame df_oes op basis van de oes data.matrix en zorg dat je de rijnamen als kolom opslaat (gebruik rownames_to_column() uit de tibble-bibliotheek).
  • Bouw de cluster-toewijzingsvector cut_oes met cutree() met h = 100,000.
  • Voeg de cluster-toewijzingen als kolom cluster toe aan de data frame df_oes en sla de resultaten op in een nieuwe data frame clust_oes.
  • Gebruik de functie pivot_longer() uit de tidyr()-bibliotheek om de gegevens te herstructureren naar een formaat dat geschikt is voor ggplot2-analyse en sla de nette data frame op als gathered_oes.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

dist_oes <- dist(oes, method = 'euclidean')
hc_oes <- hclust(dist_oes, method = 'average')

library(tibble)
library(tidyr)

# Use rownames_to_column to move the rownames into a column of the data frame
df_oes <- rownames_to_column(as.data.frame(___), var = 'occupation')

# Create a cluster assignment vector at h = 100,000
cut_oes <- cutree(___, h = ___)

# Generate the segmented oes data frame
clust_oes <- mutate(___, cluster = ___)

# Create a tidy data frame by gathering the year and values into two columns
gathered_oes <- pivot_longer(data = ___, 
                       cols = -c(occupation, cluster),
                       names_to = "year",               
                       values_to = "mean_salary" )
Code bewerken en uitvoeren