Перехресна валідація KFold
Під час роботи з моделями ML важливо оцінювати їхню якість на невидимих даних. Один із поширених підходів для цього — перехресна валідація з k блоками (k-fold). У цій вправі ви дослідите, як метод k-fold ділить набір даних на тренувальні та тестові підмножини. KFold уже імпортовано для вас, так само як і ознаки набору даних про серцеві захворювання heart_disease_df_X.
Ця вправа є частиною курсу
End-to-End Machine Learning
Інструкції до вправи
- Створіть об'єкт KFold із
n_splits=5,shuffle=Trueіrandom_state=42 - Розбийте дані за допомогою
kfold.split() - Виведіть кількість точок даних у тренувальному та тестовому розбиттях
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a KFold object
kfold = ____(____, ____, ____)
# Get the train and test data from the first split from the shuffled KFold
train_data_split, test_data_split = next(____.____(____))
# Print out the number of datapoints in the train and test splits
print("Number of training datapoints in heart_disease_df_X:", ____)
print("Number of training datapoints in split:", ____)
print("Number of testing datapoints in split:", ____)