Qu'est-ce que la régression logistique?
Le modèle que vous allez ajuster dans ce chapitre s'appelle une régression logistique. Ce modèle ressemble beaucoup à une régression linéaire, mais au lieu de prédire une variable numérique, il prédit la probabilité (entre 0 et 1) d'un événement.
Pour l'utiliser comme algorithme de classification, il suffit de fixer un seuil à ces probabilités. Si la probabilité prédite est au-dessus du seuil, vous classez l'observation comme « oui » (dans ce cas, vol en retard); si elle est en dessous, vous la classez comme « non »!
Vous peaufinerez ce modèle en testant différentes valeurs pour plusieurs hyperparamètres. Un hyperparamètre est simplement une valeur du modèle qui n'est pas estimée à partir des données, mais plutôt fournie par l'utilisateur afin de maximiser la performance. Pour ce cours, il n'est pas nécessaire de comprendre les détails mathématiques derrière toutes ces valeurs — l'important, c'est que vous essayerez quelques options et que vous choisirez la meilleure.
Pourquoi fournissez-vous des hyperparamètres?
Cette activité fait partie du cours
Fondements de PySpark
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice