始める無料で始める

可視化を使う:lmplot

線形モデルのプロットを作成すると、各変数が従属変数と関係しているかを可視化できます。関係があれば、分析に含める有力な候補です。関係がない場合でも、捨てるべきという意味ではなく、使用できるように前処理やデータ整形が必要になる可能性がある、ということです。

seaborn はエイリアス sns でワークスペースに読み込まれています。

この演習はコースの一部です

PySparkで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • 読み込まれているデータセット df から、select() を使って 'SALESCLOSEPRICE' と 'LIVINGAREA' の列だけに絞り込みます。
  • sample() を使ってデータフレームの 50% をサンプルし、置換なしで、乱数シードを 42 に設定します。
  • Spark の DataFrame を toPandas()pandas.DataFrame() に変換します。
  • 従属変数に 'SALESCLOSEPRICE'、独立変数に 'LIVINGAREA' を用いて、seaborn の lmplot() で線形モデルのプロットを作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)

# Convert to pandas dataframe
pandas_df = sample_df.____()

# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()
コードを編集して実行