ÎncepețiÎncepe gratuit

Evaluează modelul de Regresie Logistică

Acuratețea nu este, în general, o metrică foarte fiabilă, deoarece poate fi influențată de clasa țintă cea mai frecventă.

Există două alte metrici utile:

  • precizia și
  • recall-ul.

Consultă slide-urile acestei lecții pentru a găsi expresiile relevante.

Precizia reprezintă proporția predicțiilor pozitive care sunt corecte. Din toate zborurile prezise ca întârziate, ce proporție este cu adevărat întârziată?

Recall-ul reprezintă proporția rezultatelor pozitive care sunt prezise corect. Din toate zborurile întârziate, ce proporție este identificată corect de model?

Precizia și recall-ul sunt formulate, în general, în raport cu clasa țintă pozitivă. Totuși, se pot calcula și versiuni ponderate ale acestor metrici, care iau în considerare ambele clase țintă.

Componentele matricei de confuzie sunt disponibile ca TN, TP, FN și FP, precum și obiectul prediction.

Acest exercițiu face parte din cursul

Machine Learning cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Calculează precizia și recall-ul.
  • Creează un evaluator multi-clasă și evaluează precizia ponderată.
  • Creează un evaluator binar și evaluează AUC folosind metrica "areaUnderROC".

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from pyspark.ml.evaluation import MulticlassClassificationEvaluator, BinaryClassificationEvaluator

# Calculate precision and recall
precision = ____
recall = ____
print('precision = {:.2f}\nrecall    = {:.2f}'.format(precision, recall))

# Find weighted precision
multi_evaluator = ____
weighted_precision = multi_evaluator.____(prediction, {multi_evaluator.metricName: "____"})

# Find AUC
binary_evaluator = ____
auc = binary_evaluator.____(____, {____})
Editează și rulează codul