Een betrouwbaarheidsinterval bootstrappen
Een handig hulpmiddel om de variabiliteit van data te beoordelen is de bootstrap. In deze oefening schrijf je je eigen bootstrapping-functie die een gebootstrapt betrouwbaarheidsinterval kan teruggeven.
Deze functie heeft drie parameters: een 2D-array met getallen (data), een lijst met te berekenen percentielen (percentiles), en het aantal bootstrap-iteraties (n_boots). De functie gebruikt resample om een bootstrap-steekproef te genereren en herhaalt dit vervolgens meerdere keren om het betrouwbaarheidsinterval te berekenen.
Deze oefening maakt deel uit van de cursus
Machine Learning voor tijdreeksgegevens in Python
Oefeninstructies
- De functie moet loopen over het aantal bootstraps (gegeven door de parameter
n_boots) en:- Neem een willekeurige steekproef van de data, met terugleggen, en bereken het gemiddelde van deze willekeurige steekproef
- Bereken de percentielen van
bootstrap_meansen retourneer dit
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
from sklearn.utils import ____
def bootstrap_interval(data, percentiles=(2.5, 97.5), n_boots=100):
"""Bootstrap a confidence interval for the mean of columns of a 2-D dataset."""
# Create our empty array to fill the results
bootstrap_means = np.zeros([n_boots, data.shape[-1]])
for ii in range(____):
# Generate random indices for our data *with* replacement, then take the sample mean
random_sample = ____
bootstrap_means[ii] = random_sample.mean(axis=0)
# Compute the percentiles of choice for the bootstrapped means
percentiles = ____(bootstrap_means, percentiles, axis=0)
return percentiles