Tarihe dayalı başlangıç modeli
Şimdiye kadar 3 farklı başlangıç modeli kurduk. Biraz daha pratik yapmak için birkaç tane daha kuralım. İlk model, gruplama değişkenlerine dayanıyor. Yolculuk ücretinin günün saatine bağlı olabileceği açık. Örneğin, yoğun saatlerde fiyatlar daha yüksek olabilir.
Hedefin, ilgili saat için ortalama "fare_amount" değerini atayan bir başlangıç modeli kurmak. Şimdilik modeli tüm train verisi için oluşturacak ve test veri kümesi için tahmin yapacaksın.
train ve test DataFrame'leri çalışma alanında hazır. Ayrıca, her iki DataFrame'deki "pickup_datetime" sütunu senin için zaten datetime nesnesine dönüştürüldü.
Bu egzersiz, kursun bir parçasıdır
Python ile Bir Kaggle Yarışmasını Kazanmak
Egzersiz talimatları
trainvetestDataFrame'leri için "pickup_datetime" sütunundan saati al.- Train verisi üzerinde her saat için ortalama "fare_amount" değerini hesapla.
- Elde edilen grupla
pandas'ınmap()metodunu kullanaraktesttahminlerini yap. - Tahminleri dosyaya yaz.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____
# Calculate average fare_amount grouped by pickup hour
hour_groups = train.____('____')['____'].mean()
# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)
# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)