非常規估計量
在上一個練習中,你執行了簡單的自助法(bootstrap)。現在我們要把它改成可用於更複雜估計量的版本。
假設你正在研究學生的健康情況。你拿到 1000 位學生的身高與體重,想關注身高中位數,以及身高與體重之間的相關係數,並為這些量計算 95% 的信賴區間。我們來用自助法處理。
請檢視包含 1000 位學生身高與體重的 pandas DataFrame:df。在此基礎上,計算「身高中位數」與「身高與體重的相關係數」這兩者的 95% 信賴區間。
本練習屬於課程
Python 的統計模擬
練習說明
- 在
df上使用.sample()方法,以放回抽樣的方式產生一個樣本,並指定給tmp_df。 - 對於每個在
tmp_df產生的資料集,使用.median()與.corr()分別計算身高中位數,以及身高與體重之間的相關係數。 - 將身高中位數加入
height_medians,將相關係數加入hw_corr。 - 最後使用
np.percentile()為上述每個量計算 95%([2.5, 97.5])信賴區間。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Sample with replacement and calculate quantities of interest
sims, data_size, height_medians, hw_corr = 1000, df.shape[0], [], []
for i in range(sims):
tmp_df = ____(n=____, replace=____)
height_medians.append(____)
hw_corr.append(____)
# Calculate confidence intervals
height_median_ci = np.____
height_weight_corr_ci = np.____
print("Height Median CI = {} \nHeight Weight Correlation CI = {}".format( height_median_ci, height_weight_corr_ci))