Utvärdera fyra kategorier
Konfusionsmatrisen är det mest direkta verktyget för att granska de fyra utfallskategorierna: sanna positiva (TP), falska positiva (FP), sanna negativa (TN) och falska negativa (FN). I den här övningen använder du ett beslutsträd – DecisionTreeClassifier() från sklearn – på exempeldata för klick och beräknar fördelningen av utfall per kategori.
Pandas-modulen är tillgänglig som pd i din miljö och exempeldatamängden är inläst som df. Särdragen finns i X och målet i y. Dessutom är DecisionTreeClassifier från sklearn.tree tillgänglig.
Den här övningen är en del av kursen
Förutsäga CTR med maskininlärning i Python
Övningsinstruktioner
- Skapa tränings- och testuppdelningar för
Xochy. - Definiera ett beslutsträd och generera prediktioner
y_predgenom att träna modellen. - Använd konfusionsmatrisen för att få antalet utfall i varje kategori, där
1är ett positivt utfall (klick) och0är ett negativt (inget klick). - Till exempel: sanna negativa är
[0,0]och sanna positiva är[1,1].
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test)
# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]
print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))