Använda KFold-index
Du har redan skapat splits, som innehåller index för candy-datamängden för att genomföra 5-faldig korsvalidering. För att få en bättre uppskattning av hur väl en kollegas slumpskogsmodell presterar på nya data vill du köra modellen på de fem olika tränings- och valideringsindexen du just skapade.
I den här övningen använder du dessa index för att kontrollera modellens noggrannhet med hjälp av de fem olika uppdelningarna. En for-slinga har redan lagts till för att underlätta processen.
Den här övningen är en del av kursen
Modellvalidering i Python
Övningsinstruktioner
- Använd
train_indexochval_indexför att välja rätt index frånXochynär du skapar tränings- och valideringsdata. - Träna
rfcpå träningsdatamängden. - Använd
rfcför att skapa prediktioner för valideringsdatamängden och skriv ut valideringsnoggrannheten.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error
rfc = RandomForestRegressor(n_estimators=25, random_state=1111)
# Access the training and validation indices of splits
for train_index, val_index in splits:
# Setup the training and validation data
X_train, y_train = X[____], y[____]
X_val, y_val = X[____], y[____]
# Fit the random forest model
rfc.____(____, ____)
# Make predictions, and print the accuracy
predictions = rfc.____(____)
print("Split accuracy: " + str(mean_squared_error(y_val, predictions)))