НачатьНачать бесплатно

Базовая модель на основе градиентного бустинга

Построим финальную базовую модель на основе случайного леса. В видео вы видели значительный прирост качества при переходе от базовой модели на основе группировки к градиентному бустингу. Теперь воспользуйтесь случайным лесом из sklearn, чтобы улучшить результат ещё больше.

Цель этого упражнения — взять числовые признаки и обучить модель случайного леса без какой-либо настройки гиперпараметров. После этого вы сможете получить предсказания для тестовой выборки и проверить результат на публичной таблице лидеров. Обратите внимание, что у вас уже есть признак "hour", который тоже можно использовать как входной параметр модели.

Это упражнение является частью курса

Победа в соревновании Kaggle на Python

Посмотреть курс

Инструкции к упражнению

  • Добавьте признак "hour" в список числовых признаков.
  • Обучите RandomForestRegressor на обучающих данных, используя числовые признаки и "fare_amount" в качестве целевой переменной.
  • Используйте обученную модель случайного леса, чтобы получить предсказания на тестовых данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from sklearn.ensemble import RandomForestRegressor

# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
            'dropoff_latitude', 'passenger_count', ____]

# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)

# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])

# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)
Редактировать и запускать код