Folosirea indicilor KFold
Ai creat deja splits, care conține indici pentru setul de date candy-data, astfel încât să poți realiza validarea încrucișată cu 5 iterații (5-fold cross-validation). Pentru a obține o estimare mai bună a performanței modelului random forest al unui coleg pe date noi, vrei să rulezi acest model pe cele cinci combinații diferite de indici de antrenament și validare pe care tocmai le-ai creat.
În acest exercițiu, vei folosi acești indici pentru a verifica acuratețea modelului pe cele cinci împărțiri. A fost furnizată o buclă for pentru a te ajuta cu acest proces.
Acest exercițiu face parte din cursul
Validarea modelelor în Python
Instrucțiuni pentru exercițiu
- Folosește
train_indexșival_indexpentru a selecta indicii corecți dinXșiyatunci când creezi seturile de antrenament și validare. - Antrenează
rfcfolosind setul de antrenament. - Folosește
rfcpentru a genera predicții pe setul de validare și afișează acuratețea de validare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error
rfc = RandomForestRegressor(n_estimators=25, random_state=1111)
# Access the training and validation indices of splits
for train_index, val_index in splits:
# Setup the training and validation data
X_train, y_train = X[____], y[____]
X_val, y_val = X[____], y[____]
# Fit the random forest model
rfc.____(____, ____)
# Make predictions, and print the accuracy
predictions = rfc.____(____)
print("Split accuracy: " + str(mean_squared_error(y_val, predictions)))