LoslegenKostenlos starten

Das Logistic-Regression-Modell auswerten

Accuracy ist allgemein keine sehr verlässliche Metrik, weil sie durch die häufigste Zielklasse verzerrt sein kann.

Es gibt zwei weitere nützliche Metriken:

  • Precision und
  • Recall.

Schau dir die Folien zu dieser Lektion an, um die entsprechenden Formeln zu sehen.

Precision ist der Anteil der positiven Vorhersagen, die korrekt sind. Von allen Flügen, für die eine Verspätung vorhergesagt wird: Welcher Anteil ist tatsächlich verspätet?

Recall ist der Anteil der positiven Ereignisse, die korrekt vorhergesagt werden. Von allen verspäteten Flügen: Welcher Anteil wird vom Modell korrekt erkannt?

Precision und Recall werden in der Regel in Bezug auf die positive Zielklasse formuliert. Es ist aber auch möglich, gewichtete Varianten dieser Metriken zu berechnen, die beide Zielklassen berücksichtigen.

Die Bestandteile der Konfusionsmatrix stehen als TN, TP, FN und FP zur Verfügung, ebenso wie das Objekt prediction.

Diese Übung ist Teil des Kurses

<Kurs>Maschinelles Lernen mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Bestimme Precision und Recall.
  • Erzeuge einen Multi-Class-Evaluator und berechne die gewichtete Precision.
  • Erzeuge einen Binär-Evaluator und berechne die AUC mit der Metrik "areaUnderROC".

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

from pyspark.ml.evaluation import MulticlassClassificationEvaluator, BinaryClassificationEvaluator

# Calculate precision and recall
precision = ____
recall = ____
print('precision = {:.2f}\nrecall    = {:.2f}'.format(precision, recall))

# Find weighted precision
multi_evaluator = ____
weighted_precision = multi_evaluator.____(prediction, {multi_evaluator.metricName: "____"})

# Find AUC
binary_evaluator = ____
auc = binary_evaluator.____(____, {____})
Code bearbeiten und ausführen