Aan de slagBegin gratis

Evalueer het Logistic Regression-model

Accuracy is over het algemeen geen heel betrouwbare metric, omdat deze kan worden scheefgetrokken door de meest voorkomende doeldklasse.

Er zijn twee andere nuttige metrics:

  • precisie en
  • recall.

Bekijk de dia's voor deze les voor de relevante formules.

Precisie is het aandeel positieve voorspellingen dat klopt. Van alle vluchten waarvan is voorspeld dat ze vertraging hebben, welk aandeel heeft daadwerkelijk vertraging?

Recall is het aandeel positieve uitkomsten dat correct is voorspeld. Van alle vertraagde vluchten, welk aandeel wordt correct voorspeld door het model?

Precisie en recall worden meestal geformuleerd in termen van de positieve doeldklasse. Maar het is ook mogelijk om gewogen versies van deze metrics te berekenen die naar beide doelklassen kijken.

De componenten van de confusion matrix zijn beschikbaar als TN, TP, FN en FP, evenals het object prediction.

Deze oefening maakt deel uit van de cursus

Machine Learning met PySpark

Bekijk cursus

Oefeninstructies

  • Bepaal de precisie en recall.
  • Maak een multiklasse-evaluator en evalueer de gewogen precisie.
  • Maak een binaire evaluator en evalueer AUC met de metric "areaUnderROC".

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

from pyspark.ml.evaluation import MulticlassClassificationEvaluator, BinaryClassificationEvaluator

# Calculate precision and recall
precision = ____
recall = ____
print('precision = {:.2f}\nrecall    = {:.2f}'.format(precision, recall))

# Find weighted precision
multi_evaluator = ____
weighted_precision = multi_evaluator.____(prediction, {multi_evaluator.metricName: "____"})

# Find AUC
binary_evaluator = ____
auc = binary_evaluator.____(____, {____})
Code bewerken en uitvoeren