`KFold()` у scikit-learn
Ви щойно запустили код колеги, який створює модель випадкового лісу та обчислює точність на відкладеній вибірці. Ви помітили, що в коді колеги не було фіксовано початкового стану генератора випадкових чисел (random state), і знайдені вами помилки зовсім не збігалися з тими, про які повідомляв колега.
Щоб отримати кращу оцінку того, наскільки точно ця модель випадкового лісу працюватиме на нових даних, ви вирішили згенерувати індекси для KFold-кросвалідації.
Ця вправа є частиною курсу
Валідація моделей у Python
Інструкції до вправи
- Викличте метод
KFold()для розбиття даних на п'ять фолдів із перетасуванням та фіксованимrandom_state=1111. - Застосуйте метод
split()класуKFoldдоX. - Виведіть кількість індексів у списках індексів тренувальної та валідаційної вибірок.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from sklearn.model_selection import KFold
# Use KFold
kf = KFold(____, ____, ____)
# Create splits
splits = kf.____(____)
# Print the number of indices
for train_index, val_index in splits:
print("Number of training indices: %s" % len(____))
print("Number of validation indices: %s" % len(____))