Začněte nyníZačněte zdarma

Základní model založený na gradient boostingu

Teď si postavíme poslední základní model, tentokrát pomocí Random Forest. Ve videu jsi viděl/a výrazné zlepšení skóre při přechodu od skupinového základního modelu na Gradient Boosting. V tomto cvičení použiješ Random Forest z sklearn k dalšímu vylepšení tohoto skóre.

Cílem je vzít numerické příznaky a natrénovat model Random Forest bez jakéhokoli ladění. Poté budeš moci vytvořit predikce pro testovací data a ověřit výsledek na veřejném žebříčku (Public Leaderboard). Všimni si, že už máš k dispozici příznak "hour", který lze také použít jako vstup modelu.

Toto cvičení je součástí kurzu

Jak vyhrát soutěž na Kaggle v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Přidej příznak "hour" do seznamu numerických příznaků.
  • Natrénuj RandomForestRegressor na trénovacích datech s numerickými příznaky a s "fare_amount" jako cílovou proměnnou.
  • Použij natrénovaný model Random Forest k vytvoření predikcí na testovacích datech.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from sklearn.ensemble import RandomForestRegressor

# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
            'dropoff_latitude', 'passenger_count', ____]

# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)

# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])

# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)
Upravit a spustit kód