데이터셋을 다룰 때 정규화(MinMaxScaler)를 언제 사용할 수 있을까요?
MinMaxScaler
이 연습은 강의의 일부입니다
이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요
이 장에서는 특성 공학이 무엇인지, 그리고 실제 데이터에 어떻게 적용을 시작할 수 있는지 살펴봅니다. 설문 응답 데이터셋을 불러오고, 탐색하고, 시각화하면서 기본 데이터 유형을 이해하고, 그것이 특성 설계 방식에 어떤 영향을 미치는지 학습해요. pandas 패키지를 사용해 범주형 열과 연속형 열 모두에서 새로운 특성을 만들어 봅니다.
이 장에서는 지저분하고 불완전한 데이터의 현실을 다룹니다. 데이터의 결측값을 찾는 방법을 배우고, 이를 처리하는 여러 접근법을 탐색해요. 또한 문자열 조작 기법을 사용해 데이터셋의 불필요한 문자도 정리합니다.
이 장에서는 데이터의 분포 특성을 분석하고, 그것이 Machine Learning 파이프라인에 어떤 영향을 미칠지에 집중합니다. 왜도(skew)가 있는 데이터를 다루는 방법과 이상치가 분석에 부정적인 영향을 줄 수 있는 상황을 처리하는 방법을 배우게 됩니다.
현재 연습
마지막으로, 비정형 텍스트 데이터를 다루며 텍스트 말뭉치에서 열 형태의 특성을 만들어 내는 다양한 방법을 익힙니다. 서로 다른 접근 방식이 텍스트에서 얼마나 많은 문맥을 추출하는지에 어떤 영향을 미치는지 비교하고, 지나치게 많은 특성을 만들지 않으면서도 필요한 문맥을 확보하는 균형점을 찾아봅니다.