शुरू करेंमुफ़्त में शुरू करें

वैलिडेशन स्कोर को दोहराएँ

आपने वीडियो में वैलिडेशन और पब्लिक लीडरबोर्ड दोनों स्कोर देखे हैं. हालाँकि, कोड उदाहरण केवल टेस्ट डेटा के लिए उपलब्ध हैं. वैलिडेशन स्कोर पाने के लिए आपको वही प्रक्रिया होल्डआउट सेट पर दोहरानी होगी.

इस अध्याय में आप New York City Taxi प्रतियोगिता के डेटा पर काम करेंगे. समस्या यह है कि New York City में टैक्सी राइड का किराया (fare amount) प्रेडिक्ट करना है. प्रतियोगिता का मेट्रिक root mean squared error है.

पहला लक्ष्य वैलिडेशन डेटा पर बेसलाइन मॉडल का मूल्यांकन करना है. आप "fare_amount" के औसत पर आधारित सबसे सरल बेसलाइन को दोहराएँगे. याद रखें कि वैलिडेशन रणनीति के रूप में हमने 30% होल्डआउट स्प्लिट का उपयोग किया था, जिसमें validation_train ट्रेन और validation_test होल्डआउट DataFrames हैं. ये दोनों ही आपके वर्कस्पेस में उपलब्ध हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Kaggle प्रतियोगिता जीतना

पाठ्यक्रम देखें

अभ्यास निर्देश

  • पूरे validation_train DataFrame में "fare_amount" का औसत निकालें.
  • इस naive प्रेडिक्शन वैल्यू को सभी होल्डआउट प्रेडिक्शंस में असाइन करें. इन्हें "pred" कॉलम में स्टोर करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

import numpy as np
from sklearn.metrics import mean_squared_error
from math import sqrt

# Calculate the mean fare_amount on the validation_train data
naive_prediction = np.____(____['____'])

# Assign naive prediction to all the holdout observations
validation_test['pred'] = ____

# Measure the local RMSE
rmse = sqrt(mean_squared_error(validation_test['fare_amount'], validation_test['pred']))
print('Validation RMSE for Baseline I model: {:.3f}'.format(rmse))
कोड संपादित करें और चलाएँ