Aan de slagBegin gratis

Een betrouwbaarheidsinterval bootstrappen

Een handig hulpmiddel om de variabiliteit van data te beoordelen is de bootstrap. In deze oefening schrijf je je eigen bootstrapping-functie die een gebootstrapt betrouwbaarheidsinterval kan teruggeven.

Deze functie heeft drie parameters: een 2D-array met getallen (data), een lijst met te berekenen percentielen (percentiles), en het aantal bootstrap-iteraties (n_boots). De functie gebruikt resample om een bootstrap-steekproef te genereren en herhaalt dit vervolgens meerdere keren om het betrouwbaarheidsinterval te berekenen.

Deze oefening maakt deel uit van de cursus

Machine Learning voor tijdreeksgegevens in Python

Bekijk cursus

Oefeninstructies

  • De functie moet loopen over het aantal bootstraps (gegeven door de parameter n_boots) en:
    • Neem een willekeurige steekproef van de data, met terugleggen, en bereken het gemiddelde van deze willekeurige steekproef
    • Bereken de percentielen van bootstrap_means en retourneer dit

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

from sklearn.utils import ____

def bootstrap_interval(data, percentiles=(2.5, 97.5), n_boots=100):
    """Bootstrap a confidence interval for the mean of columns of a 2-D dataset."""
    # Create our empty array to fill the results
    bootstrap_means = np.zeros([n_boots, data.shape[-1]])
    for ii in range(____):
        # Generate random indices for our data *with* replacement, then take the sample mean
        random_sample = ____
        bootstrap_means[ii] = random_sample.mean(axis=0)
        
    # Compute the percentiles of choice for the bootstrapped means
    percentiles = ____(bootstrap_means, percentiles, axis=0)
    return percentiles
Code bewerken en uitvoeren