or
이 연습은 강의의 일부입니다
원시 데이터(raw data)는 분석에 가장 알맞은 형태로 오지 않는 경우가 많아요. 이 도입 장에서는 모델의 성능과 해석 가능성을 높이는 변환과 feature 생성의 첫걸음을 배웁니다.
이 장에서는 수작업 변환을 넘어, tidyverse의 도구를 활용해 프로그래밍 방식으로 새 변수를 만들어내는 방법을 배웁니다. 이 접근이 모델의 재현 가능성을 높이고, feature가 많은 데이터셋을 다룰 때 특히 유용하다는 점을 살펴봅니다.
현재 연습
이제 모델이 차원 축소와 고차원 데이터에서의 feature 추출로 자주 이점을 얻는다는 점을 학습합니다. 여기에는 텍스트 데이터를 수치로 변환하고, 범주형 데이터를 인코딩하며, 변수의 예측력을 평가하는 작업이 포함됩니다. 주성분분석(PCA), 커널 주성분분석(Kernel PCA), 텍스트에서의 수치 추출, 범주형 인코딩, 변수 중요도 점수 등의 방법을 살펴봅니다.
마지막 장에서는 feature engineering과 Machine Learning 기법을 종합합니다. 먼저 모델에 사용 가능한 모든 feature를 그대로 쓰는 데 따른 문제점과, 무관하거나 중복된 feature를 식별해 제거하는 것의 중요성을 배우고, lasso와 elastic-net 같은 내재형(embedded) 방법으로 이를 제거하는 법을 익힙니다. 다음으로 lasso, ridge, elastic-net과 같은 수축(shrinkage) 방법을 살펴보며, 가중치를 정규화하거나 계수를 0으로 만들어 feature를 선택하는 데 활용하는 방법을 배웁니다. 마지막으로 end-to-end feature engineering 워크플로를 구축하고, 소규모 프로젝트에서 앞서 배운 개념과 함수를 복습하고 실습합니다.