Grupowanie hierarchiczne: przygotowanie do eksploracji
Masz już gotowy podział danych oes na potencjalne skupienia. Zanim zaczniesz je eksplorować za pomocą ggplot2, musisz przekształcić macierz danych oes w uporządkowaną ramkę danych, w której każdy zawód ma przypisane swoje skupienie.
To ćwiczenie jest częścią kursu
Analiza skupień w R
Instrukcje do ćwiczenia
- Utwórz ramkę danych
df_oesna podstawie macierzy danychoes, pamiętając o zapisaniu nazw wierszy jako osobnej kolumny (użyj funkcjirownames_to_column()z bibliotekitibble). - Zbuduj wektor przypisań do skupień
cut_oes, używając funkcjicutree()z parametremh = 100,000. - Dołącz przypisania do skupień jako kolumnę
clusterdo ramki danychdf_oesi zapisz wynik jako nową ramkę danych o nazwieclust_oes. - Użyj funkcji
pivot_longer()z bibliotekitidyr(), aby przekształcić dane do formatu odpowiedniego dla ggplot2, i zapisz uporządkowaną ramkę danych jakogathered_oes.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
dist_oes <- dist(oes, method = 'euclidean')
hc_oes <- hclust(dist_oes, method = 'average')
library(tibble)
library(tidyr)
# Use rownames_to_column to move the rownames into a column of the data frame
df_oes <- rownames_to_column(as.data.frame(___), var = 'occupation')
# Create a cluster assignment vector at h = 100,000
cut_oes <- cutree(___, h = ___)
# Generate the segmented oes data frame
clust_oes <- mutate(___, cluster = ___)
# Create a tidy data frame by gathering the year and values into two columns
gathered_oes <- pivot_longer(data = ___,
cols = -c(occupation, cluster),
names_to = "year",
values_to = "mean_salary" )