НачатьНачать бесплатно

KFold() из scikit-learn

Вы только что запустили код коллеги, который создаёт модель случайного леса и вычисляет точность на тестовой выборке. Вы заметили, что в коде коллеги не было задано случайное состояние, и полученные вами ошибки оказались совершенно иными, чем те, что сообщил коллега.

Чтобы получить более надёжную оценку точности этой модели случайного леса на новых данных, вы решили сформировать индексы для кросс-валидации методом KFold.

Это упражнение является частью курса

Валидация моделей на Python

Посмотреть курс

Инструкции к упражнению

  • Вызовите метод KFold(), чтобы разбить данные на пять частей с перемешиванием и случайным состоянием 1111.
  • Используйте метод split() объекта KFold на данных X.
  • Выведите количество индексов в списках индексов обучающей и валидационной выборок.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from sklearn.model_selection import KFold

# Use KFold
kf = KFold(____, ____, ____)

# Create splits
splits = kf.____(____)

# Print the number of indices
for train_index, val_index in splits:
    print("Number of training indices: %s" % len(____))
    print("Number of validation indices: %s" % len(____))
Редактировать и запускать код