НачатьНачать бесплатно

Два источника вариации

Даны два набора данных «расстояние — время»: один с очень малой скоростью, другой — с большой. Обратите внимание: стандартная ошибка наклона у обоих может быть одинаковой, однако R-квадрат для моделей в целом будет различаться — в зависимости от того, насколько велик наклон («размер эффекта») по сравнению со стандартной ошибкой («неопределённостью»).

Если построить оба набора данных в виде точечных диаграмм на одних осях, различие станет очевидным. Вариация, обусловленная наклоном, отличается от вариации, вызванной случайным разбросом вокруг линии тренда. В этом упражнении ваша задача — вычислить стандартную ошибку и R-квадрат для двух наборов данных и сравнить их.

Это упражнение является частью курса

Введение в линейное моделирование на Python

Посмотреть курс

Инструкции к упражнению

  • Постройте и примените .fit() к модели ols() для обоих наборов данных — distances1 и distances2.
  • Используйте атрибут .bse полученных моделей model_1 и model_2 с ключом 'times', чтобы извлечь значения стандартной ошибки наклона из каждой модели.
  • Используйте атрибут .rsquared, чтобы извлечь значение R-квадрата из каждой модели.
  • Выведите на экран se_1, rsquared_1, se_2, rsquared_2 и сравните результаты визуально.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Build and fit two models, for columns distances1 and distances2 in df
model_1 = ols(formula="____ ~ times", data=df).____()
model_2 = ols(formula="____ ~ times", data=df).____()

# Extract R-squared for each model, and the standard error for each slope
se_1 = model_1.____['times']
se_2 = model_2.____['times']
rsquared_1 = model_1.____
rsquared_2 = model_2.____

# Print the results
print('Model 1: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
print('Model 2: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
Редактировать и запускать код