Два источника вариации
Даны два набора данных «расстояние — время»: один с очень малой скоростью, другой — с большой. Обратите внимание: стандартная ошибка наклона у обоих может быть одинаковой, однако R-квадрат для моделей в целом будет различаться — в зависимости от того, насколько велик наклон («размер эффекта») по сравнению со стандартной ошибкой («неопределённостью»).
Если построить оба набора данных в виде точечных диаграмм на одних осях, различие станет очевидным. Вариация, обусловленная наклоном, отличается от вариации, вызванной случайным разбросом вокруг линии тренда. В этом упражнении ваша задача — вычислить стандартную ошибку и R-квадрат для двух наборов данных и сравнить их.

Это упражнение является частью курса
Введение в линейное моделирование на Python
Инструкции к упражнению
- Постройте и примените
.fit()к моделиols()для обоих наборов данных —distances1иdistances2. - Используйте атрибут
.bseполученных моделейmodel_1иmodel_2с ключом'times', чтобы извлечь значения стандартной ошибки наклона из каждой модели. - Используйте атрибут
.rsquared, чтобы извлечь значение R-квадрата из каждой модели. - Выведите на экран
se_1,rsquared_1,se_2,rsquared_2и сравните результаты визуально.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Build and fit two models, for columns distances1 and distances2 in df
model_1 = ols(formula="____ ~ times", data=df).____()
model_2 = ols(formula="____ ~ times", data=df).____()
# Extract R-squared for each model, and the standard error for each slope
se_1 = model_1.____['times']
se_2 = model_2.____['times']
rsquared_1 = model_1.____
rsquared_2 = model_2.____
# Print the results
print('Model 1: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
print('Model 2: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))