Comece agoraComece grátis

Clusterização hierárquica: preparando para a exploração

Agora você criou uma possível clusterização para os dados oes. Antes de explorar esses clusters com ggplot2, será preciso transformar a matriz de dados oes em um data frame tidy, com cada ocupação associada ao seu cluster.

Este exercicio faz parte do curso

Análise de Clusters em R

Ver curso

Instruções do exercicio

  • Crie o data frame df_oes a partir da data.matrix oes, garantindo que o nome das linhas seja armazenado como uma coluna (use rownames_to_column() da biblioteca tibble).
  • Construa o vetor de atribuição de clusters cut_oes usando cutree() com h = 100,000.
  • Acrescente as atribuições de cluster como uma coluna cluster ao data frame df_oes e salve o resultado em um novo data frame chamado clust_oes.
  • Use a função pivot_longer() da biblioteca tidyr() para remodelar os dados em um formato adequado para análise no ggplot2 e salve o data frame arrumado como gathered_oes.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

dist_oes <- dist(oes, method = 'euclidean')
hc_oes <- hclust(dist_oes, method = 'average')

library(tibble)
library(tidyr)

# Use rownames_to_column to move the rownames into a column of the data frame
df_oes <- rownames_to_column(as.data.frame(___), var = 'occupation')

# Create a cluster assignment vector at h = 100,000
cut_oes <- cutree(___, h = ___)

# Generate the segmented oes data frame
clust_oes <- mutate(___, cluster = ___)

# Create a tidy data frame by gathering the year and values into two columns
gathered_oes <- pivot_longer(data = ___, 
                       cols = -c(occupation, cluster),
                       names_to = "year",               
                       values_to = "mean_salary" )
Editar e Executar Código