Variabilita ve dvou podobách
Máme k dispozici dvě datové sady zachycující závislost vzdálenosti na čase – jedna s velmi malou rychlostí, druhá s velkou rychlostí. Všimni si, že obě mohou mít stejnou standardní chybu směrnice, ale různé hodnoty R-squared pro celý model – záleží na tom, jak velká je směrnice ("velikost efektu") v porovnání se standardní chybou ("míra nejistoty").
Pokud obě datové sady vykreslíme jako bodové grafy na stejné ose, rozdíl je zřejmý. Variabilita způsobená směrnicí se liší od variability způsobené náhodným rozptylem kolem trendové linie. Cílem tohoto cvičení je vypočítat standardní chybu a R-squared pro obě datové sady a porovnat je.

Toto cvičení je součástí kurzu
Úvod do lineárního modelování v Pythonu
Pokyny k cvičení
- Sestav a pomocí
fit()natrénuj modelols()pro obě datové sadydistances1adistances2. - Z výsledných modelů
model_1amodel_2použij atribut.bsea klíč'times'k získání hodnot standardní chyby směrnice. - Pomocí atributu
.rsquaredzískej hodnotu R-squared z každého modelu. - Vypiš výsledné hodnoty
se_1,rsquared_1,se_2,rsquared_2a vizuálně je porovnej.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build and fit two models, for columns distances1 and distances2 in df
model_1 = ols(formula="____ ~ times", data=df).____()
model_2 = ols(formula="____ ~ times", data=df).____()
# Extract R-squared for each model, and the standard error for each slope
se_1 = model_1.____['times']
se_2 = model_2.____['times']
rsquared_1 = model_1.____
rsquared_2 = model_2.____
# Print the results
print('Model 1: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
print('Model 2: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))