使用可视化:lmplot
创建线性模型图可以帮助我们直观判断变量与因变量是否存在关系。若存在,它们就是值得纳入分析的候选特征。若不存在,也不意味着要丢弃,而是说明在使用前可能需要进一步处理或整理数据。
seaborn 已在您的工作区中可用,常用别名为 sns。
本练习是课程的一部分
使用 PySpark 进行特征工程
练习说明
- 使用已加载的数据集
df,通过select()只保留列 'SALESCLOSEPRICE' 和 'LIVINGAREA'。 - 使用
sample()抽样 50% 的 DataFrame,确保不放回抽样,并将随机种子设置为 42。 - 使用
toPandas()将 Spark DataFrame 转换为pandas.DataFrame()。 - 以 'SALESCLOSEPRICE' 为因变量、'LIVINGAREA' 为自变量,使用 seaborn 的
lmplot()绘制线性模型图。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()