or
이 연습은 강의의 일부입니다
이 장에서는 모델 학습, 튜닝과 선택, 특성 공학과 선택, 데이터 분할 기법까지 포함한 지도 학습 워크플로의 기본을 다시 짚습니다. 워크플로의 각 단계가 서로 어떻게 의존하는지 이해하고, 데이터 사이언티스트의 최대 적인 과적합을 어떻게 유발하거나 방지할 수 있는지 파악하게 됩니다. 이 장이 끝나면 지도 학습 전반에 이미 능숙해지고, 이후 장에서 더 고급 주제로 나아갈 준비를 마치게 될 거예요.
이전 장에서 표준 지도 학습 워크플로에 대한 이해를 완성하셨습니다. 이번 장에서는 전문가 지식이 지도 학습에 통합되는 방식을 비판적으로 살펴봅니다. 이는 적절한 분석 단위를 식별하는 과정(때로는 여러 데이터 소스를 아우르는 특성 공학이 필요할 수 있음), 때로는 불완전할 수 있는 예시 라벨링 과정, 그리고 Machine Learning 모델이 범하는 오류의 실제 비즈니스 가치를 반영하는 손실 함수를 정의하는 과정을 통해 이루어집니다.
이전 장에서는 전문가의 피드백을 워크플로에 반영하는 다양한 방법과, 이를 비즈니스 가치에 맞게 평가하는 방법을 살펴보았습니다. 이제 모델을 제품화하고 이후에도 성능을 유지하도록 반복적으로 개선하는 데 필요한 기술을 연습할 차례입니다. 또한 데이터셋 시프트를 진단하고, 환경 변화가 모델 정확도에 미치는 영향을 완화하는 방법도 배우게 됩니다.
이전 장들에서 지도 학습의 탄탄한 기초를 다지고, 프로덕션 배포에 대한 이해도 갖추셨지만, 분석에 사용할 라벨이 항상 있다고 가정했습니다. 이번 장에서는 라벨이 전혀 없거나 매우 적은 데이터를 모델링하는 도전에 나섭니다. 이는 비지도 학습의 한 형태인 이상치 탐지와, 두 예시 간 유사성에 대한 가정을 라벨 대신 활용하여 지도 학습에 필적하는 정확도를 달성할 수 있는 거리 기반 학습으로 이어집니다. 이 장을 마치면, 현실 세계의 흔한 과제를 극복하기 위해 워크플로를 어떻게 수정해야 하는지 자신 있게 도구를 선택할 수 있어, 데이터 사이언티스트들 사이에서 분명히 두각을 나타내실 거예요.
현재 연습