Comece agoraComece grátis

Efeitos da escala

Você aprendeu que, quando uma variável está em uma escala maior do que as outras do seu conjunto de dados, ela pode influenciar desproporcionalmente a distância calculada entre as observações. Vamos ver isso na prática observando uma amostra do conjunto de dados trees.

Você vai usar a função scale(), que por padrão centraliza e escala as colunas.

Nossas variáveis são as seguintes:

  • Girth - diâmetro da árvore em polegadas
  • Height - altura da árvore em polegadas

Este exercicio faz parte do curso

Análise de Clusters em R

Ver curso

Instruções do exercicio

  • Calcule a matriz de distâncias para o data frame three_trees e armazene-a como dist_trees.
  • Crie uma nova variável scaled_three_trees em que os dados de three_trees estejam centralizados e escalados.
  • Calcule e imprima a matriz de distâncias para scaled_three_trees e armazene-a como dist_scaled_trees.
  • Exiba as matrizes dist_trees e dist_scaled_trees e observe a mudança nas observações que têm a menor distância entre as duas matrizes (dica: elas mudaram).

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Calculate distance for three_trees 
dist_trees <- ___

# Scale three trees & calculate the distance  
scaled_three_trees <- ___
dist_scaled_trees <- ___

# Output the results of both Matrices
print('Without Scaling')
___

print('With Scaling')
___
Editar e Executar Código