Kom igångKom igång gratis

Utvärdera fyra kategorier

Konfusionsmatrisen är det mest direkta verktyget för att granska de fyra utfallskategorierna: sanna positiva (TP), falska positiva (FP), sanna negativa (TN) och falska negativa (FN). I den här övningen använder du ett beslutsträd – DecisionTreeClassifier() från sklearn – på exempeldata för klick och beräknar fördelningen av utfall per kategori.

Pandas-modulen är tillgänglig som pd i din miljö och exempeldatamängden är inläst som df. Särdragen finns i X och målet i y. Dessutom är DecisionTreeClassifier från sklearn.tree tillgänglig.

Den här övningen är en del av kursen

Förutsäga CTR med maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Skapa tränings- och testuppdelningar för X och y.
  • Definiera ett beslutsträd och generera prediktioner y_pred genom att träna modellen.
  • Använd konfusionsmatrisen för att få antalet utfall i varje kategori, där 1 är ett positivt utfall (klick) och 0 är ett negativt (inget klick).
  • Till exempel: sanna negativa är [0,0] och sanna positiva är [1,1].

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
  X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test) 

# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]

print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))
Redigera och kör kod