이상값 포함 및 제외 시 추론 (랜덤화)
랜덤화 검정을 사용하면 이상값이 선형 모델의 추론 결론에 미치는 영향을 다시 평가할 수 있습니다. hypdata_out 데이터에 대해 랜덤화 검정을 두 번 실행해 보세요. 한 번은 이상값을 포함한 상태로, 한 번은 이상값을 제외한 상태로 진행합니다. 확장된 코드 줄이 랜덤화 검정의 각 단계를 명확하게 나타내고 있다는 점에 주목하세요.
이 연습은 강의의 일부입니다
R을 활용한 선형 회귀 추론
연습 안내
이상값이 포함된 데이터 프레임 hypdata_out과 이상값이 제거된 데이터 프레임 hypdata_noout을 사용하여, 각각의 원본 데이터셋에 대한 순열 기울기를 담은 데이터 프레임 perm_slope_out과 perm_slope_noout이 생성되었습니다. 관측값은 변수 obs_slope_out과 obs_slope_noout에 저장되어 있습니다.
- 순열 기울기의 (
absolute value) 절댓값이 관측 기울기의 (absolute value) 절댓값보다 크거나 같은 비율을 구하여 p-값을 계산하세요. 이전과 마찬가지로,mean함수를 이진 부등식에 적용하여 비율을 구하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Calculate the p-value with the outlier
perm_slope_out %>%
mutate(abs_perm_slope = ___) %>%
summarize(p_value = ___)
# Calculate the p-value without the outlier
perm_slope_noout %>%
mutate(abs_perm_slope = ___) %>%
summarize(p_value = ___)