CommencezCommencez gratuitement

Reproduire le score de validation

Vous avez vu les scores de validation et du Public Leaderboard dans la vidéo. Cependant, les exemples de code ne sont disponibles que pour les données de test. Pour obtenir les scores de validation, vous devez refaire le même processus sur l'ensemble de conservation (holdout).

Dans tout ce chapitre, vous travaillerez avec les données du concours New York City Taxi. Le problème consiste à prédire le montant de la course pour un trajet en taxi à New York. La métrique de la compétition est la racine de l'erreur quadratique moyenne (root mean squared error).

Le premier objectif est d'évaluer le modèle de base (Baseline) sur les données de validation. Vous allez reproduire la Baseline la plus simple, basée sur la moyenne de "fare_amount". Rappelez-vous que, comme stratégie de validation, nous avons utilisé une séparation 30 % en holdout avec validation_train comme ensemble d'entraînement et validation_test comme DataFrames de holdout. Les deux sont disponibles dans votre espace de travail.

Cette activité fait partie du cours

Remporter une compétition Kaggle en Python

Voir le cours

Instructions de l’exercice

  • Calculez la moyenne de "fare_amount" sur l'ensemble du DataFrame validation_train.
  • Assignez cette valeur de prédiction naïve à toutes les prédictions du holdout. Enregistrez-les dans la colonne "pred".

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt

# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])

# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____

# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))
Modifier et exécuter le code