Replikera valideringspoängen
Du har sett både valideringspoäng och poäng från Public Leaderboard i videon. Kodexemplen gäller dock bara för testdata. För att få fram valideringspoängen behöver du upprepa samma process på holdout-datamängden.
I det här kapitlet arbetar du med data från New York City Taxi-tävlingen. Uppgiften är att förutsäga biljettpriset för en taxiresa i New York City. Tävlingens mätvärde är rotvärdet av medelkvadratfelet (RMSE).
Det första målet är att utvärdera basmodellen på valideringsdata. Du ska replikera den enklaste basmodellen, som bygger på medelvärdet av "fare_amount". Som valideringsstrategi använde vi en 30-procentig holdout-uppdelning med validation_train som träningsdataframe och validation_test som holdout-dataframe. Båda finns tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Vinna en Kaggle-tävling i Python
Övningsinstruktioner
- Beräkna medelvärdet av
"fare_amount"över helavalidation_train-dataframen. - Tilldela detta naiva förutsägelsevärde till alla holdout-förutsägelser. Spara dem i kolumnen
"pred".
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt
# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])
# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____
# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))