Utiliser des visualisations : lmplot
Créer des graphiques de modèle linéaire permet de visualiser si des variables sont liées à la variable dépendante. Si c’est le cas, elles sont de bonnes candidates à inclure dans notre analyse. Si ce n’est pas le cas, cela ne signifie pas qu’il faut les écarter ; cela implique plutôt qu’il faudra peut‑être les transformer ou les préparer avant de pouvoir les utiliser.
seaborn est disponible dans votre environnement de travail avec l’alias habituel sns.
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- À partir du jeu de données chargé
df, ne gardez que les colonnes 'SALESCLOSEPRICE' et 'LIVINGAREA' avecselect(). - Échantillonnez 50 % du DataFrame avec
sample(), sans remise et en fixant la graine aléatoire à 42. - Convertissez le DataFrame Spark en
pandas.DataFrame()avectoPandas(). - En utilisant 'SALESCLOSEPRICE' comme variable dépendante et 'LIVINGAREA' comme variable indépendante, tracez un graphique de modèle linéaire avec
lmplot()de seaborn.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()