तिथि पर आधारित बेसलाइन
हम पहले ही 3 अलग-अलग बेसलाइन मॉडल बना चुके हैं. थोड़ा और अभ्यास के लिए, आइए कुछ और बनाते हैं. पहला मॉडल grouping वैरिएबल्स पर आधारित है. यह स्पष्ट है कि ride fare दिन के हिस्से पर निर्भर कर सकती है. उदाहरण के लिए, rush hours के दौरान कीमतें अधिक हो सकती हैं.
आपका लक्ष्य एक ऐसा बेसलाइन मॉडल बनाना है जो संबंधित घंटे के लिए औसत "fare_amount" असाइन करे. अभी के लिए, आप पूरे train डेटा के लिए मॉडल बनाएँगे और test डेटासेट के लिए प्रेडिक्शंस करेंगे.
train और test DataFrames आपके workspace में उपलब्ध हैं. इसके अलावा, दोनों DataFrames में "pickup_datetime" कॉलम पहले से ही आपके लिए datetime ऑब्जेक्ट में कन्वर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Kaggle प्रतियोगिता जीतना
अभ्यास निर्देश
trainऔरtestDataFrames के लिए "pickup_datetime" कॉलम से hour निकालें.- train डेटा पर प्रत्येक hour के लिए औसत "fare_amount" की गणना करें.
- प्राप्त grouping का उपयोग करते हुए
pandasकीmap()मेथड सेtestप्रेडिक्शंस बनाएँ. - प्रेडिक्शंस को फ़ाइल में लिखें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____
# Calculate average fare_amount grouped by pickup hour
hour_groups = train.____('____')['____'].mean()
# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)
# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)