Сравнение предсказанных значений
В предыдущем упражнении вы обучили линейную модель и модель GLM (логистическую регрессию) на данных crab, предсказывая y по width. Иными словами, задача состояла в том, чтобы оценить вероятность наличия краба-сателлита рядом с самкой в зависимости от её ширины.
В этом упражнении вы подробнее изучите оценённые вероятности (выходные значения) обеих моделей и попробуете определить, подходит ли линейная модель для данной задачи.
Стандартная практика — проверять модель на новых, ранее не виденных, данных. Такой набор данных называется тестовой выборкой.
Тестовая выборка test уже создана и загружена в рабочую область. Обратите внимание, что для предсказания необходимы значения всех переменных, входящих в модель — в данном случае это width.
Набор данных crab предварительно загружен в рабочую область.
Это упражнение является частью курса
Обобщённые линейные модели в Python
Инструкции к упражнению
- С помощью
print()выведите тестовую выборкуtest. - Используя выборку
test, вычислите оценённые вероятности с помощью.predict()на основе обученной линейной моделиmodel_LMи сохраните результат вpred_lm. Затем вычислите оценённые вероятности с помощью.predict()на основе обученной модели GLM (логистической), сохранённой вmodel_GLM, и запишите результат вpred_glm. - С помощью
DataFrame()изpandasобъедините предсказания обеих моделей и сохраните результат вpredictions. - Объедините
testиpredictionsи сохраните вall_data. Выведитеall_dataс помощьюprint().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# View test set
print(____)
# Compute estimated probabilities for linear model: pred_lm
____ = model_LM.____(____)
# Compute estimated probabilities for GLM model: pred_glm
____ = model_GLM.____(____)
# Create dataframe of predictions for linear and GLM model: predictions
____ = pd.DataFrame({'Pred_LM': ____, 'Pred_GLM': ____})
# Concatenate test sample and predictions and view the results
all_data = pd.concat([____, ____], axis = 1)
print(____)