스케일의 영향
변수 중 하나가 다른 변수들보다 더 큰 스케일을 가지면, 관측치 간 거리를 계산할 때 그 변수가 불균형하게 큰 영향을 줄 수 있다는 것을 배웠습니다. 이제 trees 데이터셋의 일부 샘플을 보며 이를 직접 확인해 보겠습니다.
기본적으로 열 특성을 중심화하고 스케일링하는 scale() 함수를 사용하겠습니다.
변수는 다음과 같습니다:
- Girth - 나무 지름(인치)
- Height - 나무 높이(인치)
이 연습은 강의의 일부입니다
R로 배우는 군집 분석
연습 안내
- 데이터 프레임
three_trees에 대해 거리 행렬을 계산하고dist_trees로 저장하세요. three_trees데이터를 중심화하고 스케일링한 새 변수scaled_three_trees를 만드세요.scaled_three_trees의 거리 행렬을 계산하여 출력하고dist_scaled_trees로 저장하세요.dist_trees와dist_scaled_trees두 행렬을 모두 출력하고, 두 행렬 사이에서 어떤 관측치 쌍의 거리가 가장 작은지가 어떻게 바뀌었는지 관찰하세요 (힌트: 바뀌었습니다).
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Calculate distance for three_trees
dist_trees <- ___
# Scale three trees & calculate the distance
scaled_three_trees <- ___
dist_scaled_trees <- ___
# Output the results of both Matrices
print('Without Scaling')
___
print('With Scaling')
___