Базовая модель на основе градиентного бустинга
Построим финальную базовую модель на основе случайного леса. В видео вы видели значительный прирост качества при переходе от базовой модели на основе группировки к градиентному бустингу. Теперь воспользуйтесь случайным лесом из sklearn, чтобы улучшить результат ещё больше.
Цель этого упражнения — взять числовые признаки и обучить модель случайного леса без какой-либо настройки гиперпараметров. После этого вы сможете получить предсказания для тестовой выборки и проверить результат на публичной таблице лидеров. Обратите внимание, что у вас уже есть признак "hour", который тоже можно использовать как входной параметр модели.
Это упражнение является частью курса
Победа в соревновании Kaggle на Python
Инструкции к упражнению
- Добавьте признак
"hour"в список числовых признаков. - Обучите
RandomForestRegressorна обучающих данных, используя числовые признаки и"fare_amount"в качестве целевой переменной. - Используйте обученную модель случайного леса, чтобы получить предсказания на тестовых данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from sklearn.ensemble import RandomForestRegressor
# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
'dropoff_latitude', 'passenger_count', ____]
# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)
# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])
# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)