Základní model postavený na datu
Už jsme sestavili 3 různé základní modely. Pro procvičení si zkusme postavit ještě pár dalších. První model vychází ze seskupovacích proměnných. Je zřejmé, že cena jízdného může záviset na denní době – například během dopravní špičky bývají ceny vyšší.
Tvým úkolem je sestavit základní model, který přiřadí průměrnou hodnotu "fare_amount" odpovídající dané hodině. Tentokrát model vytvoříš na celých datech train a predikce uděláš pro dataset test.
DataFramy train a test jsou dostupné ve tvém pracovním prostředí. Sloupec "pickup_datetime" v obou DataFramech je navíc already převeden na objekt datetime.
Toto cvičení je součástí kurzu
Jak vyhrát soutěž na Kaggle v Pythonu
Pokyny k cvičení
- Získej hodinu ze sloupce "pickup_datetime" pro DataFramy
trainitest. - Vypočítej průměrné "fare_amount" pro každou hodinu na trénovacích datech.
- Vytvoř predikce pro
testpomocí metodymap()zpandasa získaného seskupení. - Zapiš predikce do souboru.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____
# Calculate average fare_amount grouped by pickup hour
hour_groups = train.____('____')['____'].mean()
# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)
# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)