可視化を使う:lmplot
線形モデルのプロットを作成すると、各変数が従属変数と関係しているかを可視化できます。関係があれば、分析に含める有力な候補です。関係がない場合でも、捨てるべきという意味ではなく、使用できるように前処理やデータ整形が必要になる可能性がある、ということです。
seaborn はエイリアス sns でワークスペースに読み込まれています。
この演習はコースの一部です
PySparkで学ぶ特徴量エンジニアリング
演習の手順
- 読み込まれているデータセット
dfから、select()を使って 'SALESCLOSEPRICE' と 'LIVINGAREA' の列だけに絞り込みます。 sample()を使ってデータフレームの 50% をサンプルし、置換なしで、乱数シードを 42 に設定します。- Spark の DataFrame を
toPandas()でpandas.DataFrame()に変換します。 - 従属変数に 'SALESCLOSEPRICE'、独立変数に 'LIVINGAREA' を用いて、seaborn の
lmplot()で線形モデルのプロットを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()