Відтворіть валідаційний бал
У відео ви бачили і валідаційний бал, і результат на Public Leaderboard. Однак приклади коду наведені лише для тестових даних. Щоб отримати валідаційні бали, треба повторити той самий процес на відкладеній вибірці.
Упродовж цього розділу ви працюватимете з даними змагання New York City Taxi. Завдання — передбачити суму оплати за поїздку на таксі в Нью-Йорку. Метрика змагання — корінь із середньоквадратичної помилки (RMSE).
Перша мета — оцінити базову модель на валідаційних даних. Ви відтворите найпростішу базову модель на основі середнього "fare_amount". Нагадаємо, як стратегію валідації ми використовували поділ 30% holdout, де validation_train — тренувальний, а validation_test — відкладений датафрейми. Обидва доступні у вашому робочому середовищі.
Ця вправа є частиною курсу
Як перемагати в змаганнях Kaggle за допомогою Python
Інструкції до вправи
- Обчисліть середнє
"fare_amount"для всього датафреймуvalidation_train. - Присвойте це наївне передбачення всім значенням у відкладеній вибірці. Збережіть їх у стовпці
"pred".
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt
# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])
# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____
# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))