Перекрёстная проверка KFold
При работе с моделями машинного обучения важно оценивать их производительность на новых данных. Одним из распространённых методов для этого является k-блочная перекрёстная проверка. В этом упражнении вы изучите, как этот метод разбивает набор данных на обучающую и тестовую выборки. Класс KFold, а также признаки набора данных о сердечных заболеваниях heart_disease_df_X уже импортированы.
Это упражнение является частью курса
Сквозное машинное обучение
Инструкции к упражнению
- Создайте объект KFold с параметрами
n_splits=5,shuffle=Trueиrandom_state=42 - Разбейте данные с помощью
kfold.split() - Выведите количество точек данных в обучающей и тестовой выборках
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a KFold object
kfold = ____(____, ____, ____)
# Get the train and test data from the first split from the shuffled KFold
train_data_split, test_data_split = next(____.____(____))
# Print out the number of datapoints in the train and test splits
print("Number of training datapoints in heart_disease_df_X:", ____)
print("Number of training datapoints in split:", ____)
print("Number of testing datapoints in split:", ____)