ПочатиПочніть безкоштовно

Прогнозування рейтингу застосунку

Після ознайомлення з набором даних про застосунки Google у попередній вправі, тепер побудуймо модель, яка передбачає рейтинг застосунку за підмножиною його ознак.

Для цього ви використаєте DecisionTreeRegressor із scikit-learn. Оскільки дерева рішень є базовими компонентами багатьох ансамблевих моделей, корисно пригадати, як вони працюють, — це стане у пригоді впродовж усього курсу.

Ми використаємо MAE (mean absolute error — середню абсолютну помилку) як метрику оцінювання. Вона добре інтерпретується, адже показує середню абсолютну різницю між фактичними та передбаченими рейтингами.

Усі потрібні модулі вже імпортовано. Ознаки та цільова змінна доступні у змінних X і y відповідно.

Ця вправа є частиною курсу

Ансамблеві методи в Python

Переглянути курс

Інструкції до вправи

  • Використайте train_test_split() для поділу X і y на тренувальну та тестову вибірки. Використайте 20% або 0.2 як розмір тесту.
  • Створіть екземпляр DecisionTreeRegressor(), reg_dt, з такими гіперпараметрами: min_samples_leaf = 3 і min_samples_split = 9.
  • Навчіть регресор на тренувальній вибірці за допомогою .fit().
  • Передбачте мітки тестової вибірки за допомогою .predict().

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Split into train (80%) and test (20%) sets
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)

# Instantiate the regressor
reg_dt = ____(____, ____, random_state=500)

# Fit to the training set
____

# Evaluate the performance of the model on the test set
y_pred = ____
print('MAE: {:.3f}'.format(mean_absolute_error(y_test, y_pred)))
Редагувати та запускати код