始める無料で始める

映画の収益を予測する

映画の収益を予測するチャレンジを、まずはシンプルな線形回帰から始めましょう。'budget' 特徴量に基づいて映画の対数収益を推定します。ここで使う評価指標は RMSE(root mean squared error、二乗平均平方根誤差)です。scikit-learn では、sklearn.metrics モジュールの mean_squared_error() 関数で MSE を計算し、その平方根を numpy で取ることで求められます。

movies データセットはすでに読み込まれ、学習用とテスト用に分割されています。さらに、欠損値は 0 で置き換え済みです。入力特徴量は StandardScaler() を使って標準化しました。Machine Learning の前処理について詳しく学びたい方は、DataCamp のデータクリーニングや特徴量エンジニアリングのコースもぜひご覧ください。

この演習はコースの一部です

Pythonで学ぶアンサンブル手法

コースを見る

演習の手順

  • 既定の LinearRegression モデルをインスタンス化します。
  • テストデータに対する予測値を計算します。
  • RMSE を計算します。mean_squared_error() 関数は 2 つの引数、y_test とその後に予測値を取ります。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Build and fit linear regression model
reg_lm = ____
reg_lm.fit(X_train, y_train)

# Calculate the predictions on the test set
pred = ____

# Evaluate the performance using the RMSE
rmse = np.sqrt(____)
print('RMSE: {:.3f}'.format(rmse))
コードを編集して実行