Prédire sur l'ensemble de test
Maintenant que vous avez séparé aléatoirement un ensemble d'entraînement et un ensemble de test, vous pouvez utiliser la fonction lm() comme dans le premier exercice pour ajuster un modèle à votre ensemble d'entraînement plutôt qu'à l'ensemble de données complet. Rappelez-vous que vous pouvez utiliser l'interface par formule de la fonction de régression linéaire pour ajuster un modèle avec une variable cible donnée en utilisant toutes les autres variables de l'ensemble de données comme prédicteurs :
mod <- lm(y ~ ., training_data)
Vous pouvez utiliser la fonction predict() pour produire des prédictions à partir de ce modèle sur de nouvelles données. Le nouvel ensemble de données doit contenir toutes les colonnes de l'ensemble d'entraînement, mais elles peuvent être dans un ordre différent et avoir des valeurs différentes. Ici, plutôt que de refaire des prédictions sur l'ensemble d'entraînement, vous pouvez prédire sur l'ensemble de test, que vous n'avez pas utilisé pour l'entraînement du modèle. Cela vous permettra de déterminer l'erreur hors échantillon du modèle dans le prochain exercice :
p <- predict(model, new_data)
Cette activité fait partie du cours
Machine Learning avec caret en R
Instructions de l’exercice
- Ajustez un modèle
lm()nommémodelpour prédirepriceen utilisant toutes les autres variables comme covariables. Assurez-vous d'utiliser l'ensemble d'entraînement,train. - Faites des prédictions sur l'ensemble de test,
test, avecpredict(). Stockez ces valeurs dans un vecteur nommép.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Fit lm model on train: model
# Predict on test: p