시작하기무료로 시작하기

비표준 추정량

이전 연습 문제에서는 간단한 부트스트랩을 실행했는데요, 이제 이를 더 복잡한 추정량에 맞게 수정해 보겠습니다.

여러분은 학생들의 건강 상태를 연구하고 있다고 가정해 볼게요. 1000명의 학생에 대한 키와 몸무게가 주어졌고, 키의 중앙값과 키-몸무게 상관관계, 그리고 각각에 대한 95% 신뢰구간에 관심이 있습니다. 부트스트래핑을 활용해 보겠습니다.

1000명의 학생 키와 몸무게가 담긴 pandas DataFrame df를 살펴보세요. 이를 사용해 키의 중앙값과 키-몸무게 간 상관계수 각각에 대한 95% 신뢰구간을 계산하세요.

이 연습은 강의의 일부입니다

Python으로 하는 통계 시뮬레이션

강의 보기

연습 안내

  • df에서 .sample() 메서드를 사용해 복원추출로 표본을 생성하고, tmp_df에 할당하세요.
  • 생성된 각 데이터셋 tmp_df에서 .median().corr()를 사용해 키의 중앙값과 키-몸무게 상관계수를 계산하세요.
  • 계산한 키 중앙값은 height_medians에, 상관계수는 hw_corr에 추가하세요.
  • 마지막으로 np.percentile()을 사용해 위 두 값 각각에 대한 95%([[2.5, 97.5]]) 신뢰구간을 계산하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Sample with replacement and calculate quantities of interest
sims, data_size, height_medians, hw_corr = 1000, df.shape[0], [], []
for i in range(sims):
    tmp_df = ____(n=____, replace=____)
    height_medians.append(____)
    hw_corr.append(____)

# Calculate confidence intervals
height_median_ci = np.____
height_weight_corr_ci = np.____
print("Height Median CI = {} \nHeight Weight Correlation CI = {}".format( height_median_ci, height_weight_corr_ci))
코드 편집 및 실행