or
Cette activité fait partie du cours
Dans ce chapitre, nous présentons la régression du point de vue du machine learning. Nous introduirons la méthode fondamentale : la régression linéaire. Nous verrons comment ajuster un modèle de régression linéaire et faire des prédictions à partir de ce modèle.
Maintenant que nous avons vu comment ajuster des modèles de régression linéaire de base, nous allons apprendre à évaluer la performance de nos modèles. Nous passerons en revue l'évaluation graphique d'un modèle et examinerons deux mesures de base pour les modèles de régression. Nous verrons aussi comment entraîner un modèle qui performe bien en situation réelle, et pas seulement sur les données d'entraînement. Même si nous illustrons ces techniques avec la régression linéaire, tous ces concepts s'appliquent à des modèles issus de tout algorithme de régression.
Exercice en cours
Avant de passer à des techniques de régression plus avancées, nous aborderons d'autres aspects de modélisation : la modélisation avec des variables catégorielles, les interactions entre variables, et les situations où il peut être pertinent de transformer les entrées et la réponse avant la modélisation. Bien que certaines techniques plus poussées gèrent automatiquement une partie de ces enjeux, il est important de les connaître pour comprendre quelles méthodes les traitent le mieux — et lesquels vous devrez encore gérer vous-même.
Maintenant que nous maîtrisons les modèles linéaires, nous allons explorer des techniques pour modéliser des situations qui ne respectent pas les hypothèses de linéarité. Cela inclut la prédiction de probabilités et de fréquences (valeurs bornées entre 0 et 1), la prédiction de comptes (valeurs entières non négatives et taux associés), ainsi que des réponses ayant une relation non linéaire mais additive avec les entrées. Ces algorithmes sont des variantes du modèle linéaire standard.
Dans ce chapitre, nous verrons des algorithmes de modélisation qui n'assument ni linéarité ni additivité, et qui peuvent apprendre certains types limités d'interactions entre variables d'entrée. Ces algorithmes sont des méthodes à base d'arbres qui reposent sur des ensembles d'arbres de décision appris à partir des données d'entraînement.