Bootstrap ve Standart Hata
Bir Milli Park’ta, görevliler park patikalarını korumanın bir parçası olarak her gün yürüyüşe çıkıyor. Her zaman aynı rotayı seçmiyorlar ama gün sonunda kat ettikleri mesafe ve süreyi kaydediyorlar. Amacımız, tek bir görevlinin sınırlı sayıdaki verisinden yola çıkarak günlük kat edilen mesafedeki değişimleri istatistiksel bir modelle açıklamak.
Hedefin, bootstrap yeniden örnekleme kullanarak her yeniden örnekleme için bir ortalama hesaplayıp ortalamaların bir dağılımını oluşturmak ve ardından standart hatayı hesaplayarak, örneklem istatistiğinin anakütle istatistiği için bir kestirici olarak taşıdığı "belirsizliği" nicelleştirmek.
Önceden yüklenmiş, kat edilen mesafeye ait 500 bağımsız ölçüm içeren sample_data dizisini kullan. Bu derste basitleştirmek için şimdilik benzetim (simüle) bir veri kümesi kullanıyoruz. İleride daha gerçekçi veriler göreceğiz.

Bu egzersiz, kursun bir parçasıdır
Python ile Doğrusal Modellemenin Temelleri
Egzersiz talimatları
sample_datayı anakütle için model olarak ata.num_resampleskez yinele:- Her seferinde
np.random.choice()kullanarak,population_modeliçindensize=resample_sizevereplace=Trueolacak şekilde birbootstrap_sampleüret. - Her seferinde örneklem ortalamasını hesapla ve sakla.
- Her seferinde
bootstrap_meansiçinnp.mean()venp.std()hesapla ve yazdır.Tanımlı
plot_data_hist()fonksiyonunu kullanarakbootstrap_meansdağılımını görselleştir.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Use the sample_data as a model for the population
population_model = ____
# Resample the population_model 100 times, computing the mean each sample
for nr in range(num_resamples):
bootstrap_sample = np.random.____(population_model, size=____, replace=____)
bootstrap_means[nr] = np.____(bootstrap_sample)
# Compute and print the mean, stdev of the resample distribution of means
distribution_mean = np.mean(____)
standard_error = np.std(____)
print('Bootstrap Distribution: center={:0.1f}, spread={:0.1f}'.format(____, ____))
# Plot the bootstrap resample distribution of means
fig = plot_data_hist(____)