CommencerCommencez gratuitement

Évaluer le modèle de régression logistique

L'accuracy n'est généralement pas un indicateur très fiable, car elle peut être biaisée par la classe cible la plus fréquente.

Deux autres métriques sont utiles :

  • la précision et
  • le rappel.

Consultez le diaporama de cette leçon pour retrouver les formules correspondantes.

La précision est la proportion de prédictions positives correctes. Parmi tous les vols prédits en retard, quelle proportion est réellement en retard ?

Le rappel est la proportion de cas positifs correctement prédits. Parmi tous les vols en retard, quelle proportion est correctement prédite par le modèle ?

La précision et le rappel sont généralement définis par rapport à la classe cible positive. Mais il est aussi possible de calculer des versions pondérées de ces métriques qui prennent en compte les deux classes cibles.

Les éléments de la matrice de confusion sont disponibles sous les noms TN, TP, FN et FP, ainsi que l'objet prediction.

Cet exercice fait partie du cours

<cours>Apprentissage automatique avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Calculez la précision et le rappel.
  • Créez un évaluateur multiclasse et évaluez la précision pondérée.
  • Créez un évaluateur binaire et évaluez l'AUC avec la métrique "areaUnderROC".

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from pyspark.ml.evaluation import MulticlassClassificationEvaluator, BinaryClassificationEvaluator

# Calculate precision and recall
precision = ____
recall = ____
print('precision = {:.2f}\nrecall    = {:.2f}'.format(precision, recall))

# Find weighted precision
multi_evaluator = ____
weighted_precision = multi_evaluator.____(prediction, {multi_evaluator.metricName: "____"})

# Find AUC
binary_evaluator = ____
auc = binary_evaluator.____(____, {____})
Modifier et exécuter le code