KFold() из scikit-learn
Вы только что запустили код коллеги, который создаёт модель случайного леса и вычисляет точность на тестовой выборке. Вы заметили, что в коде коллеги не было задано случайное состояние, и полученные вами ошибки оказались совершенно иными, чем те, что сообщил коллега.
Чтобы получить более надёжную оценку точности этой модели случайного леса на новых данных, вы решили сформировать индексы для кросс-валидации методом KFold.
Это упражнение является частью курса
Валидация моделей на Python
Инструкции к упражнению
- Вызовите метод
KFold(), чтобы разбить данные на пять частей с перемешиванием и случайным состоянием 1111. - Используйте метод
split()объектаKFoldна данныхX. - Выведите количество индексов в списках индексов обучающей и валидационной выборок.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from sklearn.model_selection import KFold
# Use KFold
kf = KFold(____, ____, ____)
# Create splits
splits = kf.____(____)
# Print the number of indices
for train_index, val_index in splits:
print("Number of training indices: %s" % len(____))
print("Number of validation indices: %s" % len(____))