ПочатиПочніть безкоштовно

Базова модель на gradient boosting

Побудуймо фінальну базову модель на основі Random Forest. У відео ви бачили значне зростання метрики під час переходу від базового групування до Gradient Boosting. Тепер ви використаєте Random Forest зі sklearn, щоб ще поліпшити результат.

Мета цієї вправи — взяти числові ознаки та навчити модель Random Forest без будь-якого тюнінгу. Після цього ви зможете зробити прогнози для тесту та перевірити результат на Public Leaderboard. Зверніть увагу, що у вас уже є ознака "hour", яку також можна подати на вхід моделі.

Ця вправа є частиною курсу

Як перемагати в змаганнях Kaggle за допомогою Python

Переглянути курс

Інструкції до вправи

  • Додайте ознаку "hour" до списку числових ознак.
  • Навчіть RandomForestRegressor на тренувальних даних із числовими ознаками та з "fare_amount" як цільовою змінною.
  • Використайте натреновану модель Random Forest, щоб зробити прогнози на тестових даних.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

from sklearn.ensemble import RandomForestRegressor

# Select only numeric features
features = ['pickup_longitude', 'pickup_latitude', 'dropoff_longitude',
            'dropoff_latitude', 'passenger_count', ____]

# Train a Random Forest model
rf = RandomForestRegressor()
rf.____(train[____], train.fare_amount)

# Make predictions on the test data
test['fare_amount'] = ____.____(test[features])

# Write predictions
test[['id','fare_amount']].to_csv('rf_sub.csv', index=False)
Редагувати та запускати код