Zacznij terazZacznij za darmo

Ocena czterech kategorii

Macierz pomyłek to najprostsze narzędzie do analizy czterech kategorii wyników: prawdziwych pozytywów (TP), fałszywych pozytywów (FP), prawdziwych negatywów (TN) i fałszywych negatywów (FN). W tym ćwiczeniu użyjesz standardowego klasyfikatora drzewa decyzyjnego DecisionTreeClassifier() z biblioteki sklearn na przykładowych danych dotyczących kliknięć i obliczysz rozkład wyników według tych czterech kategorii.

Moduł pandas jest dostępny jako pd w twoim środowisku, a przykładowy DataFrame jest wczytany jako df. Cechy są wczytane do zmiennej X, a zmienna docelowa do y. Ponadto dostępna jest klasa DecisionTreeClassifier z modułu sklearn.tree.

To ćwiczenie jest częścią kursu

Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz podziały na zbiory treningowy i testowy dla X i y.
  • Zdefiniuj klasyfikator drzewa decyzyjnego i wygeneruj prognozy y_pred, dopasowując model.
  • Użyj macierzy pomyłek, aby uzyskać liczności dla poszczególnych kategorii wyników – gdzie 1 oznacza przypadek pozytywny (kliknięcie), a 0 – przypadek negatywny (brak kliknięcia).
  • Na przykład: prawdziwe negatywy to [0,0], a prawdziwe pozytywy to [1,1].

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
  X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test) 

# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]

print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))
Edytuj i uruchom kod