or
이 연습은 강의의 일부입니다
이 챕터에서는 데이터셋을 분석할 때 결측치가 왜 위험이 될 수 있는지 알아봅니다. 결측치가 발생하는 세 가지 메커니즘을 소개하고, 통계 검정과 시각화 도구로 이를 식별하는 방법을 배웁니다.
대치 방법의 분류 체계를 익히고, 평균 대치, 핫덱(hot-deck) 대치, k-최근접이웃(k-Nearest-Neighbors) 대치의 세 가지 기증자 기반 기법을 학습합니다. 각 방법이 내부적으로 어떻게 작동하는지 살펴본 뒤, 실제 열대 기상 데이터셋에 적용해 봅니다. 그 과정에서 여러분의 문제에 더 잘 맞도록 성능을 높이는 실용적인 팁도 함께 배웁니다.
이제 선형 회귀, 로지스틱 회귀, 랜덤 포레스트와 같은 통계 및 Machine Learning 모델을 사용해 결측치를 대치하는 방법을 배울 차례입니다. 이 챕터에서는 모델이 예측을 만들어 내는 과정을 살펴보고, 그 이해를 바탕으로 조건부분포에서 대치값을 표본추출하는 방법을 사용합니다. 이는 대치값의 다양성과 개연성을 높여 실제 데이터에 더 가까워지도록 하는 데 중요합니다.
현재 연습
대치된 값은 확정값이 아닙니다. 어디까지나 추정치이며, 추정에는 불확실성이 따릅니다. 마지막 챕터에서는 부트스트래핑과 mice 패키지를 활용한 연쇄 방정식 대치(chained equations)를 통해, 대치 불확실성을 모델과 분석에 반영하여 더 신뢰 가능하고 견고한 결과를 얻는 방법을 알아봅니다.