Построение модели случайного леса
Вы снова будете работать с набором данных Pima Indians, чтобы предсказать наличие диабета у пациента — на этот раз с помощью классификатора на основе случайного леса. Вы разобьёте данные на обучающую и тестовую выборки, обучите модель и изучите значения важности признаков.
Наборы данных с признаками и целевой переменной уже загружены в переменные X и y. Необходимые пакеты и функции также подключены.
Это упражнение является частью курса
Снижение размерности в Python
Инструкции к упражнению
- Задайте размер тестовой выборки 25%, чтобы выполнить разбивку в соотношении 75% / 25%.
- Обучите классификатор случайного леса на обучающих данных.
- Вычислите точность на тестовой выборке.
- Выведите значения важности для каждого признака.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)
# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)
# Calculate the accuracy
acc = accuracy_score(____, ____)
# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))
# Print accuracy
print(f"{acc:.1%} accuracy on test set.")