Vyhodnocení modelu logistické regrese
Přesnost (accuracy) obecně není příliš spolehlivá metrika, protože ji může zkreslit nejčastěji zastoupená cílová třída.
Existují dvě další užitečné metriky:
- precision a
- recall.
Příslušné vzorce najdeš ve snímcích k této lekci.
Precision udává podíl pozitivních předpovědí, které jsou správné. Ze všech letů předpovězených jako zpožděné – jaká část skutečně zpožděná je?
Recall udává podíl pozitivních výsledků, které model správně předpoví. Ze všech zpožděných letů – jakou část model správně identifikuje?
Precision a recall se obvykle počítají vzhledem k pozitivní cílové třídě. Je ale také možné vypočítat vážené verze těchto metrik, které berou v úvahu obě cílové třídy.
Složky matice záměn jsou dostupné jako TN, TP, FN a FP, stejně jako objekt prediction.
Toto cvičení je součástí kurzu
Machine Learning with PySpark
Pokyny k cvičení
- Zjisti hodnoty precision a recall.
- Vytvoř multi-class evaluátor a vyhodnoť váženou precision.
- Vytvoř binární evaluátor a vyhodnoť AUC pomocí metriky
"areaUnderROC".
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from pyspark.ml.evaluation import MulticlassClassificationEvaluator, BinaryClassificationEvaluator
# Calculate precision and recall
precision = ____
recall = ____
print('precision = {:.2f}\nrecall = {:.2f}'.format(precision, recall))
# Find weighted precision
multi_evaluator = ____
weighted_precision = multi_evaluator.____(prediction, {multi_evaluator.metricName: "____"})
# Find AUC
binary_evaluator = ____
auc = binary_evaluator.____(____, {____})