Побудова моделі Random Forest
Ви знову працюватимете з набором даних Pima Indians, щоб передбачити, чи має людина діабет. Цього разу — за допомогою класифікатора Random Forest. Ви навчите модель на тренувальних даних після поділу на тренувальну й тестову вибірки та переглянете значення важливості ознак.
Набори ознак і цільовий набір уже завантажено для вас як X і y. Необхідні пакети та функції також підготовлено.
Ця вправа є частиною курсу
Зменшення розмірності в Python
Інструкції до вправи
- Встановіть розмір тестової вибірки 25%, щоб виконати поділ 75%–25% на тренувальну й тестову частини.
- Навчіть класифікатор Random Forest на тренувальних даних.
- Обчисліть точність на тестовій вибірці.
- Надрукуйте важливість ознак для кожної ознаки.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)
# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)
# Calculate the accuracy
acc = accuracy_score(____, ____)
# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))
# Print accuracy
print(f"{acc:.1%} accuracy on test set.")