Začněte nyníZačněte zdarma

Variabilita ve dvou podobách

Máme k dispozici dvě datové sady zachycující závislost vzdálenosti na čase – jedna s velmi malou rychlostí, druhá s velkou rychlostí. Všimni si, že obě mohou mít stejnou standardní chybu směrnice, ale různé hodnoty R-squared pro celý model – záleží na tom, jak velká je směrnice ("velikost efektu") v porovnání se standardní chybou ("míra nejistoty").

Pokud obě datové sady vykreslíme jako bodové grafy na stejné ose, rozdíl je zřejmý. Variabilita způsobená směrnicí se liší od variability způsobené náhodným rozptylem kolem trendové linie. Cílem tohoto cvičení je vypočítat standardní chybu a R-squared pro obě datové sady a porovnat je.

Toto cvičení je součástí kurzu

Úvod do lineárního modelování v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Sestav a pomocí fit() natrénuj model ols() pro obě datové sady distances1 a distances2.
  • Z výsledných modelů model_1 a model_2 použij atribut .bse a klíč 'times' k získání hodnot standardní chyby směrnice.
  • Pomocí atributu .rsquared získej hodnotu R-squared z každého modelu.
  • Vypiš výsledné hodnoty se_1, rsquared_1, se_2, rsquared_2 a vizuálně je porovnej.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Build and fit two models, for columns distances1 and distances2 in df
model_1 = ols(formula="____ ~ times", data=df).____()
model_2 = ols(formula="____ ~ times", data=df).____()

# Extract R-squared for each model, and the standard error for each slope
se_1 = model_1.____['times']
se_2 = model_2.____['times']
rsquared_1 = model_1.____
rsquared_2 = model_2.____

# Print the results
print('Model 1: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
print('Model 2: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
Upravit a spustit kód