CommencezCommencez gratuitement

Qu'est-ce que la régression logistique?

Le modèle que vous allez ajuster dans ce chapitre s'appelle une régression logistique. Ce modèle ressemble beaucoup à une régression linéaire, mais au lieu de prédire une variable numérique, il prédit la probabilité (entre 0 et 1) d'un événement.

Pour l'utiliser comme algorithme de classification, il suffit de fixer un seuil à ces probabilités. Si la probabilité prédite est au-dessus du seuil, vous classez l'observation comme « oui » (dans ce cas, vol en retard); si elle est en dessous, vous la classez comme « non »!

Vous peaufinerez ce modèle en testant différentes valeurs pour plusieurs hyperparamètres. Un hyperparamètre est simplement une valeur du modèle qui n'est pas estimée à partir des données, mais plutôt fournie par l'utilisateur afin de maximiser la performance. Pour ce cours, il n'est pas nécessaire de comprendre les détails mathématiques derrière toutes ces valeurs — l'important, c'est que vous essayerez quelques options et que vous choisirez la meilleure.

Pourquoi fournissez-vous des hyperparamètres?

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Exercice interactif pratique

Passez de la théorie à l’action grâce à l’un de nos exercices interactifs

Commencer l’exercice