Přesnost a úplnost
Přesnost (precision) i úplnost (recall) vycházejí ze čtyř výsledků, o kterých jsme mluvili v předchozí lekci, a patří k důležitým metrikám hodnocení každého modelu strojového učení. Model pro predikci CTR reklam by měl mít ideálně vysokou přesnost (vysoká návratnost investic do reklamy) i úplnost (cílení na relevantní publikum). Přesnost a úplnost sice lze vypočítat ručně, sklearn ale nabízí šikovné implementace, které snadno zapojíš do stávajícího workflow. V tomto cvičení sestavíš rozhodovací strom a vypočítáš přesnost a úplnost.
Modul pandas je dostupný jako pd a ukázkový DataFrame je načten jako df. Příznaky jsou načteny v X a cílová proměnná v y. K dispozici jsou také funkce precision_score() a recall_score() z modulu sklearn.metrics.
Toto cvičení je součástí kurzu
Předpovídání CTR pomocí Machine Learning v Pythonu
Pokyny k cvičení
- Rozděl
Xayna trénovací a testovací části. - Definuj klasifikátor rozhodovacího stromu a natrénuj model, aby vznikly predikce
y_pred. - Pomocí implementací z
sklearnzískej hodnoty přesnosti a úplnosti.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Set up training and testing split
X_train, X_test, y_train, y_test = ____(
____, ____, test_size = .2, random_state = 0)
# Create classifier and make predictions
clf = ____
y_pred = clf.____(____, _____).____(X_test)
# Evaluate precision and recall
prec = ____(y_test, ____, average = 'weighted')
recall = ____(y_test, ____, average = 'weighted')
print("Precision: %s, Recall: %s" %(prec, recall))