Replicarea scorului de validare
Ai văzut în video atât scorurile de validare, cât și cele de pe clasamentul public. Totuși, exemplele de cod sunt disponibile doar pentru datele de testare. Pentru a obține scorurile de validare, trebuie să repeți același proces pe setul de holdout.
Pe parcursul acestui capitol, vei lucra cu datele din competiția New York City Taxi. Scopul este să prezici tariful unei curse de taxi în New York City. Metrica competiției este rădăcina erorii pătratice medii (RMSE).
Primul obiectiv este să evaluezi modelul Baseline pe datele de validare. Vei replica cel mai simplu Baseline, bazat pe media coloanei "fare_amount". Reține că strategia de validare folosită este un split holdout de 30%, cu validation_train ca set de antrenament și validation_test ca DataFrame holdout. Ambele sunt disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Câștigarea unei competiții Kaggle în Python
Instrucțiuni pentru exercițiu
- Calculează media coloanei
"fare_amount"pe întregul DataFramevalidation_train. - Atribuie această valoare de predicție naivă tuturor predicțiilor din setul holdout. Stochează-le în coloana
"pred".
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt
# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])
# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____
# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))