Začněte nyníZačněte zdarma

Zopakování validačního skóre

Ve videu jsi viděl/a jak validační skóre, tak skóre na veřejném žebříčku. Ukázky kódu ale byly k dispozici jen pro testovací data. Abys získal/a validační skóre, musíš stejný postup zopakovat na holdout množině.

V celé této kapitole budeš pracovat s daty ze soutěže New York City Taxi. Úkolem je předpovědět výši jízdného za taxi v New Yorku. Metrikou soutěže je střední kvadratická chyba (RMSE).

Prvním cílem je vyhodnotit základní model (Baseline) na validačních datech. Zreplikuješ nejjednodušší Baseline, který vychází z průměru sloupce "fare_amount". Jako validační strategii jsme použili 30% holdout split – validation_train jako trénovací DataFrame a validation_test jako holdout DataFrame. Oba jsou dostupné ve tvém pracovním prostředí.

Toto cvičení je součástí kurzu

Jak vyhrát soutěž na Kaggle v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vypočítej průměr sloupce "fare_amount" přes celý DataFrame validation_train.
  • Přiřaď tuto naivní předpověď všem predikcím na holdout množině. Ulož je do sloupce "pred".

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt

# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])

# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____

# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))
Upravit a spustit kód