조금 수정된 ANSUR 데이터셋의 부분 샘플에서 머리 관련 측정치만 포함된 head_df가 미리 로드되어 있어요.
head_df
이 연습은 강의의 일부입니다
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create the boxplot head_df.____ plt.show()
차원 축소의 개념을 소개하고, 이것이 왜 그리고 언제 중요한지 살펴봅니다. 특성 선택과 특성 추출의 차이를 배우고, 두 기법을 모두 데이터 탐색에 적용해 볼 거예요. 이 장의 마지막에는 고차원 데이터셋을 시각화할 수 있게 해 주는 강력한 특성 추출 기법인 t-SNE를 다룹니다.
두 장에 걸친 특성 선택의 첫 번째 장에서는 차원의 저주와, 차원 축소가 이를 어떻게 극복하도록 돕는지 배웁니다. 분산이 거의 없거나, 결측값이 너무 많거나, 다른 특성과 강하게 상관되어 있어 데이터셋에 가치를 거의 더하지 못하는 특성을 감지하고 제거하는 여러 기법을 소개합니다.
현재 연습
특성 선택의 두 번째 장에서는, 특정 타깃 특성을 예측할 때 데이터셋에서 가장 중요한 특성을 찾도록 모델의 도움을 받는 방법을 배웁니다. 이 장의 마지막 수업에서는 서로 다른 여러 모델의 조언을 종합해 보존할 가치가 있는 특성을 결정합니다.
이 장은 가장 널리 사용되는 차원 축소 알고리즘인 주성분 분석(PCA)을 깊이 있게 다룹니다. 이 알고리즘이 왜, 어떻게 강력한지에 대한 직관을 쌓고, 데이터 탐색과 모델링 파이프라인의 전처리 모두에 적용해 볼 거예요. 멋진 이미지 압축 사례로 마무리합니다.