분석을 더 진행하려면 데이터에 대해 몇 가지 가정을 세워야 합니다.
다음 중 MCAR과 MAR에 대한 설명으로 참인 것은 무엇인가요?
MCAR
MAR
참
이 연습은 강의의 일부입니다
이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요
1장에서는 결측치에 대해 소개합니다. 결측값이 무엇인지, R에서 어떻게 작동하는지, 그리고 이를 어떻게 탐지하고 개수를 세는지 설명합니다. 이어서 결측치 요약 방법을 소개하고, 사례와 변수 전반에서 결측을 요약하는 법, 그리고 데이터 내 집단별로 탐색하는 방법을 다룹니다. 마지막으로 결측치 시각화를 살펴보며, 전체 데이터셋과 변수, 사례, 기타 요약에 대한 개괄 시각화를 만드는 법, 그리고 이를 집단별로 탐색하는 방법을 알아봅니다.
2장에서는 "missing"이나 "N/A"처럼 숨겨진 결측값을 찾아 `NA`로 바꾸는 방법을 배웁니다. 또한 명시적으로 적혀 있지는 않지만 결측으로 간주되는, 암묵적 결측값을 효율적으로 처리하는 방법도 학습합니다. 아울러 결측 데이터의 의존성을 탐색하는 법을 다루며, 완전무작위 결측(MCAR), 무작위 결측(MAR), 비무작위 결측(MNAR)의 개념과 이것이 데이터 분석에 갖는 의미를 설명합니다.
현재 연습
이 장에서는 결측 데이터를 다루는 워크플로를 배웁니다. 그림자 행렬(shadow matrix)과 nabular 데이터 같은 특수한 데이터 구조를 소개하고, 이를 활용해 결측을 탐색하는 워크플로에서 결측 요약을 원 데이터의 값과 연결하는 방법을 보여 드립니다. ggplot을 사용해 다른 변수가 결측이 될 때 값이 어떻게 변하는지 탐색하고 시각화하는 방법도 학습합니다. 마지막으로 두 변수에 걸친 결측을 시각화하는 법, 그리고 산점도에서 결측을 시각화해야 하는 이유와 그 방법을 배웁니다.
이 장에서는 데이터의 결측값을 채우는, 즉 대치(imputation)에 대해 학습합니다. 결측값을 대치하고 추적하는 방법, 그리고 대치의 장단점을 이해해 원래 값과 비교하며 대치된 데이터를 탐색, 시각화, 평가하는 법을 배웁니다. 다양한 대치 모델을 사용하고 평가·비교하는 방법, 그리고 서로 다른 대치 모델이 모델에서 도출되는 추론에 어떤 영향을 미치는지도 탐색합니다.