or
이 연습은 강의의 일부입니다
이 장에서는 가장 흔한 지저분한 데이터 문제를 해결하는 방법을 배웁니다. 데이터 타입을 변환하고, 미래 시점의 데이터 포인트를 제거하기 위해 범위 제약을 적용하며, 중복 데이터를 제거해 이중 집계를 피할 거예요.
범주형과 텍스트 데이터는 비정형적인 특성 때문에 종종 가장 지저분합니다. 이 장에서는 범주 라벨의 공백과 대소문자 불일치를 정리하고, 여러 범주를 하나로 합치며, 문자열 형식을 일관되게 재정렬하는 방법을 배웁니다.
이 장에서는 파운드 대신 모든 무게가 킬로그램으로 표기되도록 보장하는 것과 같은 더 고급 데이터 정제 문제를 다룹니다. 또한 값이 올바르게 합산되었는지 확인하고, 결측값이 분석에 부정적인 영향을 주지 않도록 검증하는 데 도움이 되는 중요한 기술도 익히게 됩니다.
현재 연습
레코드 연결은 오탈자나 서로 다른 철자가 있을 때 여러 데이터셋을 하나로 병합하는 강력한 기법입니다. 이 장에서는 문자열 간 유사도를 계산해 레코드를 연결하는 방법을 배우고, 이를 활용해 두 개의 레스토랑 리뷰 데이터셋을 하나의 깔끔한 마스터 데이터셋으로 결합해 볼 거예요.