CommencezCommencez gratuitement

Prédire sur l'ensemble de test

Maintenant que vous avez séparé aléatoirement un ensemble d'entraînement et un ensemble de test, vous pouvez utiliser la fonction lm() comme dans le premier exercice pour ajuster un modèle à votre ensemble d'entraînement plutôt qu'à l'ensemble de données complet. Rappelez-vous que vous pouvez utiliser l'interface par formule de la fonction de régression linéaire pour ajuster un modèle avec une variable cible donnée en utilisant toutes les autres variables de l'ensemble de données comme prédicteurs :

mod <- lm(y ~ ., training_data)

Vous pouvez utiliser la fonction predict() pour produire des prédictions à partir de ce modèle sur de nouvelles données. Le nouvel ensemble de données doit contenir toutes les colonnes de l'ensemble d'entraînement, mais elles peuvent être dans un ordre différent et avoir des valeurs différentes. Ici, plutôt que de refaire des prédictions sur l'ensemble d'entraînement, vous pouvez prédire sur l'ensemble de test, que vous n'avez pas utilisé pour l'entraînement du modèle. Cela vous permettra de déterminer l'erreur hors échantillon du modèle dans le prochain exercice :

p <- predict(model, new_data)

Cette activité fait partie du cours

Machine Learning avec caret en R

Voir le cours

Instructions de l’exercice

  • Ajustez un modèle lm() nommé model pour prédire price en utilisant toutes les autres variables comme covariables. Assurez-vous d'utiliser l'ensemble d'entraînement, train.
  • Faites des prédictions sur l'ensemble de test, test, avec predict(). Stockez ces valeurs dans un vecteur nommé p.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Fit lm model on train: model


# Predict on test: p
Modifier et exécuter le code