or
Cet exercice fait partie du cours
Dans ce chapitre, nous présentons la régression sous l’angle du Machine Learning. Nous introduirons la méthode fondamentale : la régression linéaire. Nous verrons comment ajuster un modèle de régression linéaire et comment l’utiliser pour faire des prédictions.
Maintenant que nous savons ajuster des modèles de régression linéaire simples, nous allons apprendre à évaluer leurs performances. Nous passerons en revue l’évaluation visuelle d’un modèle et examinerons deux métriques de base pour les modèles de régression. Nous verrons aussi comment entraîner un modèle qui se comporte bien en conditions réelles, et pas seulement sur les données d’entraînement. Bien que nous démontrions ces techniques avec la régression linéaire, tous ces concepts s’appliquent à des modèles ajustés avec n’importe quel algorithme de régression.
Exercice actuel
Avant de passer à des techniques de régression plus avancées, nous aborderons d’autres aspects de modélisation : l’utilisation de variables catégorielles, les interactions entre variables et les cas où il peut être pertinent de transformer les entrées et la sortie avant la modélisation. Même si des techniques plus sophistiquées prennent en charge une partie de ces points automatiquement, il est important de les connaître pour comprendre quelles méthodes gèrent le mieux chaque situation — et lesquelles vous devez encore traiter vous‑même.
Maintenant que nous maîtrisons les modèles linéaires, nous allons explorer des techniques adaptées aux situations qui ne respectent pas les hypothèses de linéarité. Cela inclut la prédiction de probabilités et de fréquences (valeurs comprises entre 0 et 1), la prédiction de comptages (entiers naturels et taux associés), ainsi que des réponses non linéaires mais additives par rapport aux entrées. Ces algorithmes sont des variantes du modèle linéaire standard.
Dans ce chapitre, nous étudierons des algorithmes de modélisation qui n’imposent ni linéarité ni additivité, et qui peuvent apprendre certains types d’interactions entre variables d’entrée. Ces algorithmes sont des méthodes à base d’arbres, qui fonctionnent en combinant des ensembles d’arbres de décision appris à partir des données d’entraînement.