or
이 연습은 강의의 일부입니다
이 장에서는 가장 흔한 지저분한 데이터 문제를 해결하는 방법을 배웁니다. 데이터 타입을 변환하고, 미래 시점의 값을 제거하기 위해 범위 제한을 적용하며, 중복된 데이터를 제거해 이중 집계를 피할 거예요.
범주형과 텍스트 데이터는 비정형이라는 특성 때문에 데이터셋에서 가장 지저분한 부분이 되곤 합니다. 이 장에서는 범주 라벨의 공백과 대소문자 불일치를 고치고, 여러 범주를 하나로 통합하며, 문자열 형식을 일관되게 재구성하는 방법을 배웁니다.
이 장에서는 파운드 대신 킬로그램으로 무게를 통일하는 것처럼 더 고급의 데이터 정리 문제를 다룹니다. 또한 값이 올바르게 입력되었는지 검증하고, 결측치가 분석에 부정적 영향을 주지 않도록 하는 데 필요한 핵심 기술을 익힐 수 있어요.
Record linkage는 값에 오탈자나 철자 차이가 있을 때 여러 데이터셋을 하나로 병합하는 강력한 기법입니다. 이 장에서는 문자열 간 유사도를 계산해 레코드를 연결하는 방법을 배우고, 이를 활용해 두 개의 음식점 리뷰 데이터셋을 하나의 깔끔한 마스터 데이터셋으로 결합합니다.
현재 연습