Efeitos da escala
Você aprendeu que, quando uma variável está em uma escala maior do que as outras do seu conjunto de dados, ela pode influenciar desproporcionalmente a distância calculada entre as observações. Vamos ver isso na prática observando uma amostra do conjunto de dados trees.
Você vai usar a função scale(), que por padrão centraliza e escala as colunas.
Nossas variáveis são as seguintes:
- Girth - diâmetro da árvore em polegadas
- Height - altura da árvore em polegadas
Este exercicio faz parte do curso
Análise de Clusters em R
Instruções do exercicio
- Calcule a matriz de distâncias para o data frame
three_treese armazene-a comodist_trees. - Crie uma nova variável
scaled_three_treesem que os dados dethree_treesestejam centralizados e escalados. - Calcule e imprima a matriz de distâncias para
scaled_three_treese armazene-a comodist_scaled_trees. - Exiba as matrizes
dist_treesedist_scaled_treese observe a mudança nas observações que têm a menor distância entre as duas matrizes (dica: elas mudaram).
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Calculate distance for three_trees
dist_trees <- ___
# Scale three trees & calculate the distance
scaled_three_trees <- ___
dist_scaled_trees <- ___
# Output the results of both Matrices
print('Without Scaling')
___
print('With Scaling')
___