ÎncepețiÎncepe gratuit

Folosirea indicilor KFold

Ai creat deja splits, care conține indici pentru setul de date candy-data, astfel încât să poți realiza validarea încrucișată cu 5 iterații (5-fold cross-validation). Pentru a obține o estimare mai bună a performanței modelului random forest al unui coleg pe date noi, vrei să rulezi acest model pe cele cinci combinații diferite de indici de antrenament și validare pe care tocmai le-ai creat.

În acest exercițiu, vei folosi acești indici pentru a verifica acuratețea modelului pe cele cinci împărțiri. A fost furnizată o buclă for pentru a te ajuta cu acest proces.

Acest exercițiu face parte din cursul

Validarea modelelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește train_index și val_index pentru a selecta indicii corecți din X și y atunci când creezi seturile de antrenament și validare.
  • Antrenează rfc folosind setul de antrenament.
  • Folosește rfc pentru a genera predicții pe setul de validare și afișează acuratețea de validare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error

rfc = RandomForestRegressor(n_estimators=25, random_state=1111)

# Access the training and validation indices of splits
for train_index, val_index in splits:
    # Setup the training and validation data
    X_train, y_train = X[____], y[____]
    X_val, y_val = X[____], y[____]
    # Fit the random forest model
    rfc.____(____, ____)
    # Make predictions, and print the accuracy
    predictions = rfc.____(____)
    print("Split accuracy: " + str(mean_squared_error(y_val, predictions)))
Editează și rulează codul