Hierarchical clustering: Preparing for exploration
Je hebt nu een mogelijke clustering voor de oes-gegevens gemaakt. Voordat je deze clusters met ggplot2 kunt verkennen, moet je de oes-gegevensmatrix omzetten naar een nette data frame waarin elk beroep aan zijn cluster is toegewezen.
Deze oefening maakt deel uit van de cursus
Clusteranalyse in R
Oefeninstructies
- Maak de data frame
df_oesop basis van deoesdata.matrix en zorg dat je de rijnamen als kolom opslaat (gebruikrownames_to_column()uit detibble-bibliotheek). - Bouw de cluster-toewijzingsvector
cut_oesmetcutree()meth = 100,000. - Voeg de cluster-toewijzingen als kolom
clustertoe aan de data framedf_oesen sla de resultaten op in een nieuwe data frameclust_oes. - Gebruik de functie
pivot_longer()uit detidyr()-bibliotheek om de gegevens te herstructureren naar een formaat dat geschikt is voor ggplot2-analyse en sla de nette data frame op alsgathered_oes.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
dist_oes <- dist(oes, method = 'euclidean')
hc_oes <- hclust(dist_oes, method = 'average')
library(tibble)
library(tidyr)
# Use rownames_to_column to move the rownames into a column of the data frame
df_oes <- rownames_to_column(as.data.frame(___), var = 'occupation')
# Create a cluster assignment vector at h = 100,000
cut_oes <- cutree(___, h = ___)
# Generate the segmented oes data frame
clust_oes <- mutate(___, cluster = ___)
# Create a tidy data frame by gathering the year and values into two columns
gathered_oes <- pivot_longer(data = ___,
cols = -c(occupation, cluster),
names_to = "year",
values_to = "mean_salary" )