Základní model založený na gradient boostingu
Teď si postavíme poslední základní model, tentokrát pomocí Random Forest. Ve videu jsi viděl/a výrazné zlepšení skóre při přechodu od skupinového základního modelu na Gradient Boosting. V tomto cvičení použiješ Random Forest z sklearn k dalšímu vylepšení tohoto skóre.
Cílem je vzít numerické příznaky a natrénovat model Random Forest bez jakéhokoli ladění. Poté budeš moci vytvořit predikce pro testovací data a ověřit výsledek na veřejném žebříčku (Public Leaderboard). Všimni si, že už máš k dispozici příznak "hour", který lze také použít jako vstup modelu.
Toto cvičení je součástí kurzu
Jak vyhrát soutěž na Kaggle v Pythonu
Pokyny k cvičení
- Přidej příznak
"hour"do seznamu numerických příznaků. - Natrénuj
RandomForestRegressorna trénovacích datech s numerickými příznaky a s"fare_amount"jako cílovou proměnnou. - Použij natrénovaný model Random Forest k vytvoření predikcí na testovacích datech.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.ensemble import RandomForestRegressor
# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
'dropoff_latitude', 'passenger_count', ____]
# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)
# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])
# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)