Evaluarea celor patru categorii
Matricea de confuzie este cel mai direct instrument pentru a analiza cele patru categorii de rezultate: pozitive adevărate (TP), pozitive false (FP), negative adevărate (TN) și negative false (FN). În acest exercițiu, vei folosi un clasificator standard de tip arbore de decizie — DecisionTreeClassifier() din sklearn — pe datele de exemplu privind clicurile, pentru a calcula distribuția rezultatelor pe cele patru categorii.
Modulul pandas este disponibil ca pd în spațiul tău de lucru, iar DataFrame-ul de exemplu este încărcat ca df. Caracteristicile sunt încărcate în X, iar ținta este încărcată în y. De asemenea, DecisionTreeClassifier din sklearn.tree este disponibil.
Acest exercițiu face parte din cursul
Predicția CTR cu Machine Learning în Python
Instrucțiuni pentru exercițiu
- Obține seturile de antrenament și de testare pentru
Xșiy. - Definește un clasificator de tip arbore de decizie și generează predicțiile
y_predprin antrenarea modelului. - Folosește matricea de confuzie pentru a obține numărul de exemple din fiecare categorie de rezultate, unde
1reprezintă un pozitiv (clic) și0reprezintă un negativ (neclic). - De exemplu: negativele adevărate corespund indexului
[0,0], iar pozitivele adevărate corespund indexului[1,1].
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test)
# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]
print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))