scikit-learns KFold()
Du har precis kört en kollegas kod som skapar en random forest-modell och beräknar en out-of-sample-noggrannhet. Du märkte att kollegans kod saknade ett random state, och felen du hittade skilde sig helt från de fel kollegan rapporterade.
För att få en bättre uppskattning av hur väl random forest-modellen presterar på ny data har du beslutat att generera index att använda för KFold-korsvalidering.
Den här övningen är en del av kursen
Modellvalidering i Python
Övningsinstruktioner
- Anropa metoden
KFold()för att dela upp data med fem uppdelningar, blandning och ett random state på 1111. - Använd metoden
split()frånKFoldpåX. - Skriv ut antalet index i både tränings- och valideringsindexlistorna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from sklearn.model_selection import KFold
# Use KFold
kf = KFold(____, ____, ____)
# Create splits
splits = kf.____(____)
# Print the number of indices
for train_index, val_index in splits:
print("Number of training indices: %s" % len(____))
print("Number of validation indices: %s" % len(____))