or
이 연습은 강의의 일부입니다
이 장에서는 데이터 전처리가 무엇을 의미하는지 정확히 배우게 됩니다. 데이터 형식을 살펴보고 결측치를 다루는 등 전처리의 첫 단계를 진행해 볼 거예요.
이 장의 핵심 주제는 데이터 표준화입니다. 많은 모델은 특성의 분포나 스케일에 대해 가정을 합니다. 표준화는 데이터를 이러한 가정에 맞추어 알고리즘 성능을 높이는 방법이에요.
이 절에서는 Feature Engineering을 배웁니다. 데이터셋에 이미 있는 특성으로부터 새로운, 더 유용한 특성을 만드는 다양한 방법을 살펴봅니다. 수치형과 텍스트 특성에서 정보를 인코딩하고 집계하며 추출하는 방법을 보게 될 거예요.
현재 연습
이 장에서는 데이터셋에서 가장 중요한 특성을 선택하는 여러 기법을 다룹니다. 중복된 특성을 제거하고, 텍스트 벡터를 활용하며, 주성분 분석(PCA)을 사용해 데이터셋의 특성 수를 줄이는 방법을 배우게 됩니다.
이제 전처리에 대해 모두 배웠으니, UFO 목격 정보를 담은 데이터셋에 이러한 기법을 적용해 보겠습니다.