Začněte nyníZačněte zdarma

Základní model postavený na datu

Už jsme sestavili 3 různé základní modely. Pro procvičení si zkusme postavit ještě pár dalších. První model vychází ze seskupovacích proměnných. Je zřejmé, že cena jízdného může záviset na denní době – například během dopravní špičky bývají ceny vyšší.

Tvým úkolem je sestavit základní model, který přiřadí průměrnou hodnotu "fare_amount" odpovídající dané hodině. Tentokrát model vytvoříš na celých datech train a predikce uděláš pro dataset test.

DataFramy train a test jsou dostupné ve tvém pracovním prostředí. Sloupec "pickup_datetime" v obou DataFramech je navíc already převeden na objekt datetime.

Toto cvičení je součástí kurzu

Jak vyhrát soutěž na Kaggle v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Získej hodinu ze sloupce "pickup_datetime" pro DataFramy train i test.
  • Vypočítej průměrné "fare_amount" pro každou hodinu na trénovacích datech.
  • Vytvoř predikce pro test pomocí metody map() z pandas a získaného seskupení.
  • Zapiš predikce do souboru.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Get pickup hour from the pickup_datetime column
train['hour'] = train['pickup_datetime'].dt.____
test['hour'] = test['pickup_datetime'].dt.____

# Calculate average fare_amount grouped by pickup hour 
hour_groups = train.____('____')['____'].mean()

# Make predictions on the test set
test['fare_amount'] = test.hour.map(____)

# Write predictions
test[['id','fare_amount']].____('hour_mean_sub.csv', index=False)
Upravit a spustit kód