Zmienność w dwóch częściach
Masz do dyspozycji dwa zbiory danych przedstawiające zależność odległości od czasu – jeden z bardzo małą prędkością, drugi z dużą. Zauważ, że oba mogą mieć ten sam błąd standardowy nachylenia, ale różne wartości R-kwadrat dla całego modelu, w zależności od wielkości nachylenia ("wielkości efektu") w porównaniu z błędem standardowym ("niepewnością").
Jeśli wykreślisz oba zbiory danych jako wykresy punktowe na tych samych osiach, różnica stanie się wyraźna. Zmienność wynikająca z nachylenia różni się od zmienności spowodowanej losowym rozrzutem wokół linii trendu. Celem tego ćwiczenia jest obliczenie błędu standardowego i R-kwadrat dla obu zbiorów danych oraz ich porównanie.

To ćwiczenie jest częścią kursu
Wprowadzenie do modelowania liniowego w Pythonie
Instrukcje do ćwiczenia
- Zbuduj i dopasuj (
fit()) modelols()dla obu zbiorów danych:distances1idistances2. - Użyj atrybutu
.bsewynikowych modelimodel_1imodel_2oraz klucza'times', aby wyodrębnić wartości błędu standardowego nachylenia z każdego modelu. - Użyj atrybutu
.rsquared, aby wyodrębnić wartość R-kwadrat z każdego modelu. - Wyświetl wynikowe wartości
se_1,rsquared_1,se_2,rsquared_2i porównaj je wzrokowo.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build and fit two models, for columns distances1 and distances2 in df
model_1 = ols(formula="____ ~ times", data=df).____()
model_2 = ols(formula="____ ~ times", data=df).____()
# Extract R-squared for each model, and the standard error for each slope
se_1 = model_1.____['times']
se_2 = model_2.____['times']
rsquared_1 = model_1.____
rsquared_2 = model_2.____
# Print the results
print('Model 1: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
print('Model 2: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))