НачатьНачать бесплатно

Воспроизведение результата на валидации

В видео вы видели как результаты на валидации, так и результаты публичной таблицы лидеров. Однако примеры кода были приведены только для тестовых данных. Чтобы получить результаты на валидации, нужно повторить тот же процесс на отложенной выборке.

В этой главе вы будете работать с данными соревнования New York City Taxi. Задача — предсказать стоимость поездки на такси в Нью-Йорке. Метрика соревнования — среднеквадратичная ошибка (RMSE).

Первая цель — оценить базовую модель на валидационных данных. Вы воспроизведёте простейшую базовую модель, основанную на среднем значении столбца "fare_amount". Напомним, что в качестве стратегии валидации использовалось разбиение с отложенной выборкой 30%: validation_train — обучающая часть, validation_test — отложенная. Оба набора данных доступны в вашем рабочем пространстве.

Это упражнение является частью курса

Победа в соревновании Kaggle на Python

Посмотреть курс

Инструкции к упражнению

  • Вычислите среднее значение столбца "fare_amount" по всему набору данных validation_train.
  • Присвойте это наивное прогнозируемое значение всем предсказаниям на отложенной выборке. Сохраните их в столбце "pred".

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt

# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])

# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____

# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))
Редактировать и запускать код