Korzystanie z indeksów KFold
Masz już utworzoną zmienną splits, która zawiera indeksy dla zbioru danych candy-data potrzebne do przeprowadzenia 5-krotnej walidacji krzyżowej. Aby lepiej oszacować, jak dobrze model lasu losowego twojego kolegi poradzi sobie z nowymi danymi, chcesz uruchomić ten model na pięciu różnych zestawach indeksów treningowych i walidacyjnych, które właśnie zostały utworzone.
W tym ćwiczeniu użyjesz tych indeksów, aby sprawdzić dokładność modelu na pięciu różnych podziałach. Pętla for jest już przygotowana – pomoże ci przejść przez ten proces.
To ćwiczenie jest częścią kursu
Walidacja modeli w Pythonie
Instrukcje do ćwiczenia
- Użyj
train_indexival_index, aby wybrać odpowiednie indeksy zXiypodczas tworzenia danych treningowych i walidacyjnych. - Dopasuj
rfcdo zbioru treningowego. - Użyj
rfcdo wygenerowania predykcji na zbiorze walidacyjnym i wyświetl dokładność walidacji.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
from sklearn.ensemble import RandomForestRegressor
from sklearn.metrics import mean_squared_error
rfc = RandomForestRegressor(n_estimators=25, random_state=1111)
# Access the training and validation indices of splits
for train_index, val_index in splits:
# Setup the training and validation data
X_train, y_train = X[____], y[____]
X_val, y_val = X[____], y[____]
# Fit the random forest model
rfc.____(____, ____)
# Make predictions, and print the accuracy
predictions = rfc.____(____)
print("Split accuracy: " + str(mean_squared_error(y_val, predictions)))