Utiliser des visualisations : lmplot
Créer des graphiques de modèle linéaire permet de voir si des variables sont liées à la variable dépendante. Si c'est le cas, elles sont de bonnes candidates à inclure dans notre analyse. Si ce n'est pas le cas, cela ne veut pas dire qu'il faut les écarter ; il faudra peut-être les traiter ou les transformer avant de pouvoir les utiliser.
seaborn est disponible dans votre espace de travail avec l'alias habituel sns.
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- En utilisant le jeu de données chargé
df, filtrez-le pour ne garder que les colonnes 'SALESCLOSEPRICE' et 'LIVINGAREA' avecselect(). - Échantillonnez 50 % du DataFrame avec
sample()en vous assurant de ne pas utiliser de remise et en fixant la graine aléatoire à 42. - Convertissez le DataFrame Spark en
pandas.DataFrame()avectoPandas(). - En utilisant 'SALESCLOSEPRICE' comme variable dépendante et 'LIVINGAREA' comme variable indépendante, tracez un graphique de modèle linéaire avec
lmplot()de seaborn.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()