or
이 연습은 강의의 일부입니다
군집 분석은 서로 비슷한 관측치들을 묶어 내되, 각 집단은 서로 다른 특징을 갖도록 찾는 작업이에요. 이러한 유사성과 차이는 거리라는 척도로 표현합니다. 이 장에서는 연속형과 범주형 특성에 대해 관측치 간 거리를 계산하는 방법을 배웁니다. 또한 특성의 스케일이 거리 계산에 어떤 영향을 주는지도 직관적으로 이해하게 될 거예요.
현재 연습
이 장은 1장에서 마지막으로 던졌던 질문—계산한 거리를 이용해 데이터에서 어떻게 비슷한 관측치들의 집단(클러스터)을 찾을 수 있을까?—에 답하도록 도와줍니다. 계층적 군집화의 핵심 개념인 연결 기준(linkage criteria)과 덴드로그램(dendrogram) 플롯을 배우고, 이 둘이 클러스터를 형성하는 데 어떻게 사용되는지 살펴봅니다. 또한 도매 유통업체의 데이터를 탐색하며, 고객의 지출 패턴을 이용해 시장 세분화를 수행해 볼 거예요.
이 장에서는 k-means 알고리즘의 원리를 이해하고, 사전에 k가 알려져 있지 않을 때 적절한 k를 선택하는 방법을 배웁니다. 그리고 도매 데이터를 다른 관점에서 다시 살펴봅니다.
이 장에서는 지금까지 배운 기술을 적용해 직업별 평균 임금이 시간에 따라 어떻게 변해 왔는지 탐구합니다.