НачатьНачать бесплатно

Построение модели случайного леса

Вы снова будете работать с набором данных Pima Indians, чтобы предсказать наличие диабета у пациента — на этот раз с помощью классификатора на основе случайного леса. Вы разобьёте данные на обучающую и тестовую выборки, обучите модель и изучите значения важности признаков.

Наборы данных с признаками и целевой переменной уже загружены в переменные X и y. Необходимые пакеты и функции также подключены.

Это упражнение является частью курса

Снижение размерности в Python

Посмотреть курс

Инструкции к упражнению

  • Задайте размер тестовой выборки 25%, чтобы выполнить разбивку в соотношении 75% / 25%.
  • Обучите классификатор случайного леса на обучающих данных.
  • Вычислите точность на тестовой выборке.
  • Выведите значения важности для каждого признака.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)

# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)

# Calculate the accuracy
acc = accuracy_score(____, ____)

# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))

# Print accuracy
print(f"{acc:.1%} accuracy on test set.") 
Редактировать и запускать код