Ocena czterech kategorii
Macierz pomyłek to najprostsze narzędzie do analizy czterech kategorii wyników: prawdziwych pozytywów (TP), fałszywych pozytywów (FP), prawdziwych negatywów (TN) i fałszywych negatywów (FN). W tym ćwiczeniu użyjesz standardowego klasyfikatora drzewa decyzyjnego DecisionTreeClassifier() z biblioteki sklearn na przykładowych danych dotyczących kliknięć i obliczysz rozkład wyników według tych czterech kategorii.
Moduł pandas jest dostępny jako pd w twoim środowisku, a przykładowy DataFrame jest wczytany jako df. Cechy są wczytane do zmiennej X, a zmienna docelowa do y. Ponadto dostępna jest klasa DecisionTreeClassifier z modułu sklearn.tree.
To ćwiczenie jest częścią kursu
Przewidywanie CTR z użyciem uczenia maszynowego w Pythonie
Instrukcje do ćwiczenia
- Utwórz podziały na zbiory treningowy i testowy dla
Xiy. - Zdefiniuj klasyfikator drzewa decyzyjnego i wygeneruj prognozy
y_pred, dopasowując model. - Użyj macierzy pomyłek, aby uzyskać liczności dla poszczególnych kategorii wyników – gdzie
1oznacza przypadek pozytywny (kliknięcie), a0– przypadek negatywny (brak kliknięcia). - Na przykład: prawdziwe negatywy to
[0,0], a prawdziwe pozytywy to[1,1].
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test)
# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]
print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))