Variatie in twee delen
Gegeven twee gegevenssets met afstand-tegen-tijd-data: één met een heel kleine snelheid en één met een grote snelheid. Let op dat beide dezelfde standaardfout van de helling kunnen hebben, maar een andere R-kwadraat voor het model als geheel, afhankelijk van de grootte van de helling ("effectgrootte") vergeleken met de standaardfout ("onzekerheid").
Als we beide gegevenssets als scatterplots in dezelfde assen weergeven, wordt het contrast duidelijk. Variatie door de helling is iets anders dan variatie door de willekeurige spreiding rond de trendlijn. In deze oefening is je doel om de standaardfout en R-kwadraat voor twee gegevenssets te berekenen en te vergelijken.

Deze oefening maakt deel uit van de cursus
Introductie tot lineaire modellering in Python
Oefeninstructies
- Bouw en
fit()eenols()-model voor beide gegevenssetsdistances1endistances2. - Gebruik de
.bsevan de resulterende modellenmodel_1enmodel_2, en de sleutel'times'om de standaardfoutwaarden voor de helling uit elk model te halen. - Gebruik het attribuut
.rsquaredom de R-kwadraatwaarde uit elk model te halen. - Print de resulterende
se_1,rsquared_1,se_2,rsquared_2, en vergelijk ze visueel.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Build and fit two models, for columns distances1 and distances2 in df
model_1 = ols(formula="____ ~ times", data=df).____()
model_2 = ols(formula="____ ~ times", data=df).____()
# Extract R-squared for each model, and the standard error for each slope
se_1 = model_1.____['times']
se_2 = model_2.____['times']
rsquared_1 = model_1.____
rsquared_2 = model_2.____
# Print the results
print('Model 1: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
print('Model 2: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))