Прогнозування рейтингу застосунку
Після ознайомлення з набором даних про застосунки Google у попередній вправі, тепер побудуймо модель, яка передбачає рейтинг застосунку за підмножиною його ознак.
Для цього ви використаєте DecisionTreeRegressor із scikit-learn. Оскільки дерева рішень є базовими компонентами багатьох ансамблевих моделей, корисно пригадати, як вони працюють, — це стане у пригоді впродовж усього курсу.
Ми використаємо MAE (mean absolute error — середню абсолютну помилку) як метрику оцінювання. Вона добре інтерпретується, адже показує середню абсолютну різницю між фактичними та передбаченими рейтингами.
Усі потрібні модулі вже імпортовано. Ознаки та цільова змінна доступні у змінних X і y відповідно.
Ця вправа є частиною курсу
Ансамблеві методи в Python
Інструкції до вправи
- Використайте
train_test_split()для поділуXіyна тренувальну та тестову вибірки. Використайте 20% або0.2як розмір тесту. - Створіть екземпляр
DecisionTreeRegressor(),reg_dt, з такими гіперпараметрами:min_samples_leaf = 3іmin_samples_split = 9. - Навчіть регресор на тренувальній вибірці за допомогою
.fit(). - Передбачте мітки тестової вибірки за допомогою
.predict().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Split into train (80%) and test (20%) sets
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)
# Instantiate the regressor
reg_dt = ____(____, ____, random_state=500)
# Fit to the training set
____
# Evaluate the performance of the model on the test set
y_pred = ____
print('MAE: {:.3f}'.format(mean_absolute_error(y_test, y_pred)))