Bộ ước lượng phi tiêu chuẩn
Trong bài tập trước, bạn đã chạy một bootstrap đơn giản mà giờ chúng ta sẽ điều chỉnh cho các bộ ước lượng phức tạp hơn.
Giả sử bạn đang nghiên cứu sức khỏe của học sinh. Bạn có số đo chiều cao và cân nặng của 1000 học sinh và bạn quan tâm đến trung vị chiều cao cũng như tương quan giữa chiều cao và cân nặng, kèm theo khoảng tin cậy 95% cho các đại lượng này. Hãy dùng bootstrapping.
Xem pandas DataFrame df với chiều cao và cân nặng của 1000 học sinh. Từ đó, hãy tính khoảng tin cậy 95% cho cả trung vị chiều cao và tương quan giữa chiều cao và cân nặng.
Bài tập này là một phần của khóa học
Mô phỏng Thống kê bằng Python
Hướng dẫn bài tập
- Dùng phương thức
.sample()trêndfđể tạo một mẫu dữ liệu có hoàn lại và gán vàotmp_df. - Với mỗi bộ dữ liệu sinh ra trong
tmp_df, tính trung vị chiều cao và tương quan giữa chiều cao với cân nặng bằng.median()và.corr(). - Thêm trung vị chiều cao vào
height_mediansvà hệ số tương quan vàohw_corr. - Cuối cùng, tính khoảng tin cậy 95% (
[2.5, 97.5]) cho từng đại lượng trên bằngnp.percentile().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Sample with replacement and calculate quantities of interest
sims, data_size, height_medians, hw_corr = 1000, df.shape[0], [], []
for i in range(sims):
tmp_df = ____(n=____, replace=____)
height_medians.append(____)
hw_corr.append(____)
# Calculate confidence intervals
height_median_ci = np.____
height_weight_corr_ci = np.____
print("Height Median CI = {} \nHeight Weight Correlation CI = {}".format( height_median_ci, height_weight_corr_ci))