Replikacja wyniku walidacji
W filmie pokazano zarówno wyniki walidacji, jak i wyniki z Publicznego Rankingu (Public Leaderboard). Jednak przykłady kodu dotyczą wyłącznie danych testowych. Aby uzyskać wyniki walidacji, musisz powtórzyć ten sam proces na zbiorze holdout.
W tym rozdziale będziesz pracować z danymi z konkursu New York City Taxi. Zadanie polega na przewidzeniu kwoty opłaty za przejazd taksówką w Nowym Jorku. Metryka konkursu to pierwiastek z błędu średniokwadratowego (RMSE).
Pierwszym celem jest ocena modelu bazowego na danych walidacyjnych. Zreplikujesz najprostszy model bazowy oparty na średniej kolumny "fare_amount". Jako strategię walidacji przyjęto podział holdout z 30% danych, gdzie validation_train to zbiór treningowy, a validation_test to zbiór holdout. Oba są dostępne w twoim środowisku pracy.
To ćwiczenie jest częścią kursu
Zwycięstwo w konkursie Kaggle w Pythonie
Instrukcje do ćwiczenia
- Oblicz średnią kolumny
"fare_amount"dla całego DataFramevalidation_train. - Przypisz tę naiwną wartość prognozy do wszystkich predykcji w zbiorze holdout. Zapisz je w kolumnie
"pred".
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt
# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])
# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____
# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))