Validare încrucișată
Validarea încrucișată este o tehnică folosită pentru a evalua performanța unui model pe date noi. Se aplică pentru a verifica dacă rezultatele obținute pe setul de testare nu sunt influențate de modul în care au fost împărțite datele. În acest exercițiu, vei folosi implementări din sklearn pentru a rula o validare încrucișată K-Fold cu ajutorul modulului KFold(), evaluând precizia și recall-ul unui arbore de decizie.
X_train, y_train, X_test, y_test sunt disponibile în spațiul tău de lucru. pandas ca pd, numpy ca np și sklearn sunt de asemenea disponibile. KFold() și cross_val_score() din sklearn.model_selection sunt ambele disponibile.
Acest exercițiu face parte din cursul
Predicția CTR cu Machine Learning în Python
Instrucțiuni pentru exercițiu
- Creează un clasificator de tip arbore de decizie.
- Configurează o validare încrucișată K-Fold cu patru împărțiri și atribuie rezultatul variabilei
k-fold. - Folosește
k_foldpentru a rula validarea încrucișată cucross_val_score(), evaluând precizia și recall-ul modelului tău (fără a folosirecall_score()sauprecision_score()!).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create model
clf = ____
# Set up k-fold
k_fold = ____(n_splits = 4, random_state = 0, shuffle = True)
# Evaluate precision and recall for each fold
precision = ____(
clf, X_train, ____, cv = ____, scoring = 'precision_weighted')
recall = ____(
clf, X_train, ____, cv = ____, scoring = 'recall_weighted')
print("Precision scores: %s" %(precision))
print("Recall scores: %s" %(recall))