or
이 연습은 강의의 일부입니다
뉴스 기사를 분류할 준비를 하기 전에, 먼저 군집화의 기초를 알아야 합니다. 이 장에서는 비지도 학습이라 불리는 Machine Learning 알고리즘의 한 범주를 소개하고, 그중에서도 대표적인 방법인 군집화를 다룹니다. 널리 쓰이는 두 가지 군집화 기법인 계층적 군집화와 k-평균 군집화에 대해 배우게 됩니다. 마지막으로, 데이터 군집화를 시작하기 전에 필요한 기본 전처리 단계로 장을 마무리합니다.
이 장에서는 널리 사용되는 군집화 알고리즘인 계층적 군집화와 SciPy에서의 구현에 집중합니다. 계층적 군집화를 수행하는 절차와 더불어, 데이터에 클러스터가 몇 개 있는지라는 중요한 질문에 답하는 데 도움을 드립니다. 마지막에는 계층적 군집화의 한계를 살펴보고, 이 방법을 사용할 때 고려해야 할 사항들을 논의합니다.
현재 연습
이 장에서는 또 다른 군집화 알고리즘인 k-평균 군집화와 그 SciPy 구현을 소개합니다. k-평균 군집화는 이전 장에서 다룬 계층적 군집화의 가장 큰 단점을 보완합니다. 수형도는 계층적 군집화에 특화되어 있으므로, 이 장에서는 k-평균 군집화를 실행하기 전에 클러스터 개수를 정하는 한 가지 방법을 다룹니다. 마지막에는 k-평균 군집화의 한계를 살펴보고, 이 알고리즘을 사용할 때 고려해야 할 점들을 논의합니다.
이제 가장 널리 쓰이는 두 가지 군집화 기법에 익숙해졌으니, 이 장에서는 이를 실제 문제에 적용해 봅니다. 먼저 이미지에서 지배 색상을 찾는 과정을 다룬 뒤, 도입부에서 언급한 뉴스 기사 군집화 문제로 넘어갑니다. 마지막에는 변수가 여러 개인 군집화에 대해 논의하며, 모든 데이터를 시각화하기가 왜 어려운지도 살펴봅니다.