Análise de silhueta
A análise de silhueta permite calcular o quão semelhante cada observação é ao cluster ao qual foi atribuída em relação aos outros clusters. Essa métrica (largura da silhueta) varia de -1 a 1 para cada observação nos seus dados e pode ser interpretada da seguinte forma:
- Valores próximos de 1 sugerem que a observação está bem ajustada ao cluster atribuído
- Valores próximos de 0 sugerem que a observação está na fronteira entre dois clusters
- Valores próximos de -1 sugerem que a observação pode ter sido atribuída ao cluster errado
Neste exercício, você vai usar as funções pam() e silhouette() da biblioteca cluster para realizar a análise de silhueta e comparar os resultados de modelos com k igual a 2 e k igual a 3. Você continuará trabalhando com o conjunto de dados lineup.
Preste bastante atenção ao gráfico de silhueta: cada observação pertence claramente ao cluster atribuído para k = 3?
Este exercicio faz parte do curso
Análise de Clusters em R
Instruções do exercicio
- Gere um modelo de k-means
pam_k2usandopam()comk = 2nos dadoslineup. - Plote a análise de silhueta usando
plot(silhouette(model)). - Repita os dois primeiros passos para
k = 3, salvando o modelo comopam_k3. - Antes de prosseguir, revise as diferenças entre os gráficos (especialmente a observação 3) para
pam_k3.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
library(cluster)
# Generate a k-means model using the pam() function with a k = 2
pam_k2 <- pam(___, k = ___)
# Plot the silhouette visual for the pam_k2 model
plot(silhouette(___))
# Generate a k-means model using the pam() function with a k = 3
pam_k3 <- ___
# Plot the silhouette visual for the pam_k3 model