ÎncepețiÎncepe gratuit

Replicarea scorului de validare

Ai văzut în video atât scorurile de validare, cât și cele de pe clasamentul public. Totuși, exemplele de cod sunt disponibile doar pentru datele de testare. Pentru a obține scorurile de validare, trebuie să repeți același proces pe setul de holdout.

Pe parcursul acestui capitol, vei lucra cu datele din competiția New York City Taxi. Scopul este să prezici tariful unei curse de taxi în New York City. Metrica competiției este rădăcina erorii pătratice medii (RMSE).

Primul obiectiv este să evaluezi modelul Baseline pe datele de validare. Vei replica cel mai simplu Baseline, bazat pe media coloanei "fare_amount". Reține că strategia de validare folosită este un split holdout de 30%, cu validation_train ca set de antrenament și validation_test ca DataFrame holdout. Ambele sunt disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Câștigarea unei competiții Kaggle în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează media coloanei "fare_amount" pe întregul DataFrame validation_train.
  • Atribuie această valoare de predicție naivă tuturor predicțiilor din setul holdout. Stochează-le în coloana "pred".

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt

# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])

# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____

# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))
Editează și rulează codul