始める無料で始める

2つに分かれる変動

距離と時間の2つのデータセットが与えられます。1つは非常に小さい速度、もう1つは大きい速度です。どちらも傾きの標準誤差は同じになる場合がありますが、傾き(「効果量」)の大きさに対して標準誤差(「不確かさ」)がどの程度かによって、モデル全体の R-squared は異なり得ます。

両方のデータセットを同じ座標上に散布図として描くと、その違いがはっきり分かります。傾きによる変動は、トレンドラインの周りのランダムな散らばりによる変動とは異なります。この演習では、2つのデータセットについて標準誤差と R-squared を計算し、比較することが目標です。

この演習はコースの一部です

Pythonで学ぶ線形モデリング入門

コースを見る

演習の手順

  • distances1distances2 の両方について、ols() モデルを構築し、fit() します。
  • 得られた model_1model_2.bse'times' キーを使って、各モデルから傾きの標準誤差を取り出します。
  • .rsquared 属性を使って、各モデルから R-squared の値を取り出します。
  • 得られた se_1rsquared_1se_2rsquared_2 を表示し、見た目で比較します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Build and fit two models, for columns distances1 and distances2 in df
model_1 = ols(formula="____ ~ times", data=df).____()
model_2 = ols(formula="____ ~ times", data=df).____()

# Extract R-squared for each model, and the standard error for each slope
se_1 = model_1.____['times']
se_2 = model_2.____['times']
rsquared_1 = model_1.____
rsquared_2 = model_2.____

# Print the results
print('Model 1: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
print('Model 2: SE = {:0.3f}, R-squared = {:0.3f}'.format(____, ____))
コードを編集して実行