ग्रेडिएंट बूस्टिंग पर आधारित बेसलाइन
आइए Random Forest पर आधारित एक अंतिम बेसलाइन बनाते हैं। आपने वीडियो में ग्रूपिंग बेसलाइन से Gradient Boosting पर जाते ही स्कोर में जबरदस्त सुधार देखा। अब, आप sklearn की Random Forest का उपयोग करके इस स्कोर को और बेहतर करेंगे.
इस अभ्यास का लक्ष्य है कि न्यूमेरिक फीचर्स लें और बिना किसी ट्यूनिंग के एक Random Forest मॉडल ट्रेन करें। उसके बाद, आप टेस्ट प्रीडिक्शन बना सकेंगे और पब्लिक लीडरबोर्ड पर परिणाम वैलिडेट कर सकेंगे। ध्यान दें कि आपके पास पहले से "hour" फीचर है, जिसे मॉडल के इनपुट के रूप में भी इस्तेमाल किया जा सकता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Kaggle प्रतियोगिता जीतना
अभ्यास निर्देश
- न्यूमेरिक फीचर्स की सूची में
"hour"फीचर जोड़ें. - न्यूमेरिक फीचर्स वाले ट्रेन डेटा पर
RandomForestRegressorफिट करें और टार्गेट के रूप में"fare_amount"का उपयोग करें. - ट्रेन्ड Random Forest मॉडल से टेस्ट डेटा पर प्रीडिक्शन बनाएं.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from sklearn.ensemble import RandomForestRegressor
# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
'dropoff_latitude', 'passenger_count', ____]
# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)
# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])
# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)