CommencerCommencez gratuitement

Qu'est-ce que la régression logistique ?

Le modèle que vous allez ajuster dans ce chapitre est appelé régression logistique. Ce modèle est très similaire à une régression linéaire, mais au lieu de prédire une variable numérique, il prédit la probabilité (entre 0 et 1) d'un événement.

Pour utiliser cela comme algorithme de classification, il suffit d'attribuer un seuil à ces probabilités. Si la probabilité prévue est supérieure au seuil, vous classez cette observation comme un « oui » (dans ce cas, le vol est en retard), si elle est inférieure, vous la classez comme un « non » !

Vous ajusterez ce modèle en testant différentes valeurs pour plusieurs hyperparamètres. Un hyperparamètre est simplement une valeur dans le modèle qui n'est pas estimée à partir des données, mais plutôt fournie par l'utilisateur afin d'optimiser les performances. Pour ce cours, il n'est pas nécessaire de comprendre les mathématiques qui sous-tendent toutes ces valeurs. Ce qui importe, c'est que vous essayiez plusieurs options différentes et que vous choisissiez la meilleure.

Pourquoi fournissez-vous des hyperparamètres ?

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Exercice interactif pratique

Transformez la théorie en action avec l’un de nos exercices interactifs

Commencer l’exercice