or
이 연습은 강의의 일부입니다
대용량 데이터셋을 더 단순하게 만들어 볼 준비를 하세요! 정보의 개념, 피처 중요도 평가 방법을 배우고, 정보량이 낮은 피처를 식별하는 연습을 합니다. 이 장을 마치면 차원 축소의 두 가지 접근 방식인 피처 선택과 피처 추출의 차이를 이해하게 됩니다.
결측치 비율, 분산, 상관관계를 활용해 정보가 많은 피처와 정보가 적은 피처를 식별하는 방법을 배웁니다. 그런 다음 이러한 정보 지표를 사용해 피처를 선택하는 tidymodels 레시피를 만드는 방법을 살펴봅니다.
3장에서는 비지도 학습과 지도 학습 기반 피처 선택의 차이를 소개합니다. tidymodels 워크플로를 사용해 모델을 구축하는 절차를 복습한 뒤, lasso 회귀와 랜덤 포레스트 모델로 지도 학습 기반 피처 선택을 수행합니다.
현재 연습
마지막 장에서는 주성분이 서로 다른 피처에서 가장 중요한 정보를 어떻게 추출하고 결합하는지 이해하여 피처 추출에 대한 직관을 탄탄히 다집니다. 이어서 세 가지 피처 추출 기법 — 주성분 분석(PCA), t-SNE, UMAP — 을 학습하고 적용해 봅니다. 또한 tidymodels의 모델 구축 과정에서 이러한 피처 추출 방법을 전처리 단계로 활용하는 방법을 알아봅니다.