Zacznij terazZacznij za darmo

Grupowanie hierarchiczne: przygotowanie do eksploracji

Masz już gotowy podział danych oes na potencjalne skupienia. Zanim zaczniesz je eksplorować za pomocą ggplot2, musisz przekształcić macierz danych oes w uporządkowaną ramkę danych, w której każdy zawód ma przypisane swoje skupienie.

To ćwiczenie jest częścią kursu

Analiza skupień w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz ramkę danych df_oes na podstawie macierzy danych oes, pamiętając o zapisaniu nazw wierszy jako osobnej kolumny (użyj funkcji rownames_to_column() z biblioteki tibble).
  • Zbuduj wektor przypisań do skupień cut_oes, używając funkcji cutree() z parametrem h = 100,000.
  • Dołącz przypisania do skupień jako kolumnę cluster do ramki danych df_oes i zapisz wynik jako nową ramkę danych o nazwie clust_oes.
  • Użyj funkcji pivot_longer() z biblioteki tidyr(), aby przekształcić dane do formatu odpowiedniego dla ggplot2, i zapisz uporządkowaną ramkę danych jako gathered_oes.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

dist_oes <- dist(oes, method = 'euclidean')
hc_oes <- hclust(dist_oes, method = 'average')

library(tibble)
library(tidyr)

# Use rownames_to_column to move the rownames into a column of the data frame
df_oes <- rownames_to_column(as.data.frame(___), var = 'occupation')

# Create a cluster assignment vector at h = 100,000
cut_oes <- cutree(___, h = ___)

# Generate the segmented oes data frame
clust_oes <- mutate(___, cluster = ___)

# Create a tidy data frame by gathering the year and values into two columns
gathered_oes <- pivot_longer(data = ___, 
                       cols = -c(occupation, cluster),
                       names_to = "year",               
                       values_to = "mean_salary" )
Edytuj i uruchom kod