CommencezCommencez gratuitement

Prédire les revenus d'un film

Commençons le défi de prédire les revenus des films en construisant une régression linéaire simple pour estimer le logarithme des revenus à partir de la caractéristique 'budget'. La mesure que vous utiliserez ici est la RMSE (root mean squared error). Pour la calculer avec scikit-learn, vous pouvez utiliser la fonction mean_squared_error() du module sklearn.metrics, puis en prendre la racine carrée avec numpy.

Le jeu de données movies a été chargé pour vous et séparé en ensembles d'entraînement et de test. De plus, les valeurs manquantes ont été remplacées par des zéros. Nous avons aussi normalisé la caractéristique d'entrée à l'aide de StandardScaler(). Consultez les cours de DataCamp sur le nettoyage des données et l'ingénierie des caractéristiques si vous souhaitez en savoir plus sur la préparation des données pour le Machine Learning.

Cette activité fait partie du cours

Méthodes d'ensemble en Python

Voir le cours

Instructions de l’exercice

  • Instanciez le modèle LinearRegression par défaut.
  • Calculez les prédictions sur l'ensemble de test.
  • Calculez la RMSE. La fonction mean_squared_error() exige deux arguments : y_test, suivi des prédictions.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))
Modifier et exécuter le code