Kom igångKom igång gratis

Replikera valideringspoängen

Du har sett både valideringspoäng och poäng från Public Leaderboard i videon. Kodexemplen gäller dock bara för testdata. För att få fram valideringspoängen behöver du upprepa samma process på holdout-datamängden.

I det här kapitlet arbetar du med data från New York City Taxi-tävlingen. Uppgiften är att förutsäga biljettpriset för en taxiresa i New York City. Tävlingens mätvärde är rotvärdet av medelkvadratfelet (RMSE).

Det första målet är att utvärdera basmodellen på valideringsdata. Du ska replikera den enklaste basmodellen, som bygger på medelvärdet av "fare_amount". Som valideringsstrategi använde vi en 30-procentig holdout-uppdelning med validation_train som träningsdataframe och validation_test som holdout-dataframe. Båda finns tillgängliga i din arbetsyta.

Den här övningen är en del av kursen

Vinna en Kaggle-tävling i Python

Visa kurs

Övningsinstruktioner

  • Beräkna medelvärdet av "fare_amount" över hela validation_train-dataframen.
  • Tilldela detta naiva förutsägelsevärde till alla holdout-förutsägelser. Spara dem i kolumnen "pred".

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt

# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])

# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____

# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))
Redigera och kör kod