Začněte nyníZačněte zdarma

Vyhodnocení modelu logistické regrese

Přesnost (accuracy) obecně není příliš spolehlivá metrika, protože ji může zkreslit nejčastěji zastoupená cílová třída.

Existují dvě další užitečné metriky:

  • precision a
  • recall.

Příslušné vzorce najdeš ve snímcích k této lekci.

Precision udává podíl pozitivních předpovědí, které jsou správné. Ze všech letů předpovězených jako zpožděné – jaká část skutečně zpožděná je?

Recall udává podíl pozitivních výsledků, které model správně předpoví. Ze všech zpožděných letů – jakou část model správně identifikuje?

Precision a recall se obvykle počítají vzhledem k pozitivní cílové třídě. Je ale také možné vypočítat vážené verze těchto metrik, které berou v úvahu obě cílové třídy.

Složky matice záměn jsou dostupné jako TN, TP, FN a FP, stejně jako objekt prediction.

Toto cvičení je součástí kurzu

Machine Learning with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Zjisti hodnoty precision a recall.
  • Vytvoř multi-class evaluátor a vyhodnoť váženou precision.
  • Vytvoř binární evaluátor a vyhodnoť AUC pomocí metriky "areaUnderROC".

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from pyspark.ml.evaluation import MulticlassClassificationEvaluator, BinaryClassificationEvaluator

# Calculate precision and recall
precision = ____
recall = ____
print('precision = {:.2f}\nrecall    = {:.2f}'.format(precision, recall))

# Find weighted precision
multi_evaluator = ____
weighted_precision = multi_evaluator.____(prediction, {multi_evaluator.metricName: "____"})

# Find AUC
binary_evaluator = ____
auc = binary_evaluator.____(____, {____})
Upravit a spustit kód