Базова модель на gradient boosting
Побудуймо фінальну базову модель на основі Random Forest. У відео ви бачили значне зростання метрики під час переходу від базового групування до Gradient Boosting. Тепер ви використаєте Random Forest зі sklearn, щоб ще поліпшити результат.
Мета цієї вправи — взяти числові ознаки та навчити модель Random Forest без будь-якого тюнінгу. Після цього ви зможете зробити прогнози для тесту та перевірити результат на Public Leaderboard. Зверніть увагу, що у вас уже є ознака "hour", яку також можна подати на вхід моделі.
Ця вправа є частиною курсу
Як перемагати в змаганнях Kaggle за допомогою Python
Інструкції до вправи
- Додайте ознаку
"hour"до списку числових ознак. - Навчіть
RandomForestRegressorна тренувальних даних із числовими ознаками та з"fare_amount"як цільовою змінною. - Використайте натреновану модель Random Forest, щоб зробити прогнози на тестових даних.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from sklearn.ensemble import RandomForestRegressor
# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
'dropoff_latitude', 'passenger_count', ____]
# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)
# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])
# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)