ПочатиПочніть безкоштовно

Відтворіть валідаційний бал

У відео ви бачили і валідаційний бал, і результат на Public Leaderboard. Однак приклади коду наведені лише для тестових даних. Щоб отримати валідаційні бали, треба повторити той самий процес на відкладеній вибірці.

Упродовж цього розділу ви працюватимете з даними змагання New York City Taxi. Завдання — передбачити суму оплати за поїздку на таксі в Нью-Йорку. Метрика змагання — корінь із середньоквадратичної помилки (RMSE).

Перша мета — оцінити базову модель на валідаційних даних. Ви відтворите найпростішу базову модель на основі середнього "fare_amount". Нагадаємо, як стратегію валідації ми використовували поділ 30% holdout, де validation_train — тренувальний, а validation_test — відкладений датафрейми. Обидва доступні у вашому робочому середовищі.

Ця вправа є частиною курсу

Як перемагати в змаганнях Kaggle за допомогою Python

Переглянути курс

Інструкції до вправи

  • Обчисліть середнє "fare_amount" для всього датафрейму validation_train.
  • Присвойте це наївне передбачення всім значенням у відкладеній вибірці. Збережіть їх у стовпці "pred".

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt

# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])

# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____

# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))
Редагувати та запускати код