or
이 연습은 강의의 일부입니다
이 장에서는 특성 공학이 무엇인지, 그리고 실제 데이터에 어떻게 적용을 시작할 수 있는지 살펴봅니다. 설문 응답 데이터셋을 불러오고, 탐색하고, 시각화하면서 기본 데이터 유형을 이해하고, 그것이 특성 설계 방식에 어떤 영향을 미치는지 학습해요. pandas 패키지를 사용해 범주형 열과 연속형 열 모두에서 새로운 특성을 만들어 봅니다.
이 장에서는 지저분하고 불완전한 데이터의 현실을 다룹니다. 데이터의 결측값을 찾는 방법을 배우고, 이를 처리하는 여러 접근법을 탐색해요. 또한 문자열 조작 기법을 사용해 데이터셋의 불필요한 문자도 정리합니다.
이 장에서는 데이터의 분포 특성을 분석하고, 그것이 Machine Learning 파이프라인에 어떤 영향을 미칠지에 집중합니다. 왜도(skew)가 있는 데이터를 다루는 방법과 이상치가 분석에 부정적인 영향을 줄 수 있는 상황을 처리하는 방법을 배우게 됩니다.
마지막으로, 비정형 텍스트 데이터를 다루며 텍스트 말뭉치에서 열 형태의 특성을 만들어 내는 다양한 방법을 익힙니다. 서로 다른 접근 방식이 텍스트에서 얼마나 많은 문맥을 추출하는지에 어떤 영향을 미치는지 비교하고, 지나치게 많은 특성을 만들지 않으면서도 필요한 문맥을 확보하는 균형점을 찾아봅니다.
현재 연습